arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 18 篇

2409.06679 2026-04-15 cs.CL 90%

E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning

E2LLM:用于长上下文理解与推理的编码器扩展大语言模型

Zihan Liao, Jun Wang, Hang Yu, Lingxiao Wei, Jianguo Li, Jun Wang, Wei Zhang

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出E2LLM,通过分块压缩和适配器对齐,解决长上下文处理中的性能、效率与兼容性难题,在文档摘要和问答任务中优于现有方法。

Comments Accept by EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03174 2026-04-15 cs.CL cs.AI 90%

LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability

LLM作为具有注意力机制的NTM及话题建模作为长输入生成:可解释性与长上下文能力

Xuan Xu, Zhongliang Yang, Haolun Li, Beilin Chu, Rui Tian, Yu Li, Shaolin Tan, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology Beijing(北京科技大学) Beijing Value Simplex Technology Co. Ltd(北京价值简单科技有限公司) Zhongguancun Laboratory(中关村实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文从白盒和黑盒视角研究基于LLM的话题建模,提出注意力引导框架恢复可解释结构,并通过长输入任务和信号补偿方法提升性能,验证LLM与NTM的联系及长上下文LLM在话题建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 90%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12898 2026-04-15 cs.AI math.CO 90%

BEAM: Bi-level Memory-adaptive Algorithmic Evolution for LLM-Powered Heuristic Design

BEAM:基于LLM的双层记忆自适应算法进化用于启发式设计

Chuyang Xiang, Yichen Wei, Jiale Ma, Handing Wang, Junchi Yan

机构 * IEEE

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BEAM通过双层优化方法,结合遗传算法和MCTS,改进LLM驱动的启发式设计,有效提升复杂代码生成效率,实验显示在CVRP混合算法设计中优化差距减少37.84%。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12816 2026-04-15 cs.CL 90%

The role of System 1 and System 2 semantic memory structure in human and LLM biases

系统1和系统2语义记忆结构在人类和LLM中的作用

Katherine Abramski, Giulio Rossetti, Massimo Stella

机构 * Department of Computer Science, University of Pisa, Italy(意大利比萨大学计算机科学系) Institute of Information Science and Technologies - National Research Council, Italy(意大利信息科学与技术研究所-国家研究理事会) CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento, Italy(意大利特伦托大学心理学与认知科学系CogNosco实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过对比人类和LLM的语义记忆结构,揭示隐性偏见的来源,发现人类语义结构能减少偏见,而LLM缺乏这种人类特有的概念知识。

Comments 31 pages, 5 figures, 9 appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12285 2026-04-15 cs.AI 90%

GAM: Hierarchical Graph-based Agentic Memory for LLM Agents

GAM:基于图的代理记忆用于大语言模型代理

Zhaofen Wu, Hanrong Zhang, Fulin Lin, Wujiang Xu, Xinran Xu, Yankai Chen, Henry Peng Zou, Shaowen Chen, Weizhi Zhang, Xue Liu, Philip S. Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Rutgers University(罗格斯大学) MBZUAI(麦吉尔大学人工智能研究所) McGill University(麦吉尔大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAM框架,通过解耦记忆编码与巩固,解决LLM代理在快速上下文感知与稳定知识保留间的矛盾,提升推理准确性和效率。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12167 2026-04-15 cs.AI cs.NE 89%

EMBER: Autonomous Cognitive Behaviour from Learned Spiking Neural Network Dynamics in a Hybrid LLM Architecture

EMBER:在混合大语言模型架构中通过学习的脉冲神经网络动态实现自主认知行为

William Savage

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出EMBER架构,通过学习的脉冲神经网络动态实现大语言模型与记忆之间的关系重组,利用STDP和奖励调节学习实现自主行为决策。

Comments Preprint. 9 pages, 2 figures, 3 tables. NeurIPS 2026 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12231 2026-04-15 cs.CL cs.IR 86%

Thought-Retriever: Don't Just Retrieve Raw Data, Retrieve Thoughts for Memory-Augmented Agentic Systems

Thought-Retriever: 不只是检索原始数据,为记忆增强型智能体检索思想

Tao Feng, Pengrui Han, Guanyu Lin, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Thought-Retriever,一种无需受上下文长度限制的算法,使LLM能基于任意长外部数据生成输出。通过利用历史查询生成的中间响应,构建长期记忆,提升回答能力。

Journal ref Transactions on Machine Learning Research (TMLR), 04/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12776 2026-04-15 cs.CL 81%

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution

EvoSpark:内生交互代理社会的统一长周期叙述进化

Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 EvoSpark通过内生交互代理社会框架,解决LLM多代理系统中长周期叙述演化的矛盾,通过分层叙述记忆和生成场景机制实现逻辑一致的持续叙事。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12056 2026-04-15 cs.CL cs.LG 81%

LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models

LoSA:基于块状扩散语言模型的局部意识稀疏注意力

Haocheng Xi, Harman Singh, Yuezhou Hu, Coleman Hooper, Rishabh Tiwari, Aditya Tomar, Minjae Lee, Wonjun Kang, Michael Mahoney, Chenfeng Xu, Kurt Keutzer, Amir Gholami

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 LoSA通过局部意识稀疏注意力机制,针对块状扩散语言模型中的KV膨胀问题,优化注意力计算,提升效率和精度,实现更高的准确率和速度。

Comments 16 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17086 2026-04-15 cs.CL 77%

Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning

通过最小化强化学习推进多智能体RAG系统

Yihong Wu, Liheng Ma, Muzhi Li, Jiaming Zhou, Lei Ding, Jianye Hao, Ho-fung Leung, Irwin King, Yingxue Zhang, Jian-Yun Nie

机构 * McGill University \& Mila Montréal QC Canada The Chinese University of Hong Kong Hong Kong China Huawei Noah’s Ark Lab Montréal QC Canada University of Manitoba Winnipeg MB Canada Tianjin University Tianjin China Independent Researcher Hong Kong China McGill University \& Mila The Chinese University of Hong Kong Huawei Noah’s Ark Lab University of Manitoba Tianjin University Independent Researcher

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出Mujica-MyGo框架,通过多智能体RAG流程分解多轮交互,结合轻量强化学习算法MyGO,有效解决长上下文问题,提升复杂问答性能。

Comments AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10898 2026-04-15 cs.LG cs.AI cs.CL 75%

ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval

ZoomR:通过多粒度键值检索实现内存高效的推理

David H. Yang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Subhajit Chaudhury, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZoomR通过多粒度键值检索实现内存高效的推理,减少内存使用,适用于长输出生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12034 2026-04-15 cs.AI 70%

Memory as Metabolism: A Design for Companion Knowledge Systems

记忆作为代谢:一种陪伴知识系统的 设计

Stefan Miteski

机构 * CODE University Berlin(CODE大学柏林)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种针对单用户知识维基的治理框架,通过五项操作处理记忆中的矛盾证据,以避免固化问题。

Comments 41 pages, 1 table. Preprint v3.642. Concept DOI: 10.5281/zenodo.19501651

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12007 2026-04-15 cs.AI 70%

When to Forget: A Memory Governance Primitive

何时遗忘:一种记忆治理原语

Baris Simsek

机构 * Baris Simsek(巴里·西姆塞克)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Memory Worth,一种通过跟踪记忆与成功/失败结果共现次数来评估记忆质量的机制,为动态管理提供理论基础,并在实验中验证其有效性。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18081 2026-04-15 cs.LG 70%

DRPG (Decompose, Retrieve, Plan, Generate): An Agentic Framework for Academic Rebuttal

DRPG(分解、检索、计划、生成):一种用于学术反驳的代理框架

Peixuan Han, Yingjie Yu, Jingjun Xu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DRPG框架,通过分解评审、检索证据、计划反驳策略和生成回应四个步骤,提升学术反驳的自动化水平,实验表明其性能超越现有方法并达到人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12048 2026-04-15 cs.SE 67%

ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation

ORBIT: 用于自主C到Rust转换的引导代理 orchestration

Muhammad Farrukh, Baris Coskun, Tapti Palit, Michalis Polychronakis

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 ORBIT 提出一种自主代理框架,通过动态上下文收集和依赖引导 orchestration 实现项目级 C到Rust转换,显著提升大规模代码转换的准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12717 2026-04-15 cs.AI 57%

Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning

通过现实世界案例学习实现自主代理的可迁移专业技能

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Letian Yang, Xukai Jiang

机构 * National Glycoengineering Research Center, Shandong University(山东大学糖工程研究中心) State Key Laboratory of Microbial Technology, Shandong University(山东省微生物技术重点实验室)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出基于案例学习的框架,通过将过往任务经验转化为可重用的知识资产,使自主代理能迁移先前经验以执行更结构化的分析,在六个复杂任务类别基准测试中表现优异,尤其在复杂任务上优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12357 2026-04-15 cs.AI cs.CV 57%

ReflectCAP: Detailed Image Captioning with Reflective Memory

ReflectCAP: 基于反思记忆的详细图像描述

Kyungmin Min, Minbeom Kim, Kang-il Lee, Seunghyun Yoon, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系) Adobe Research(Adobe研究)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 ReflectCAP通过反思笔记指导生成详细且准确的图像描述,平衡事实性和覆盖性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏