LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 长上下文与记忆 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)
Comments Code will release soon
专题命中 长上下文与记忆 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Code available at https://github.com/aiwaves-cn/agents
专题命中 长上下文与记忆 :foundation model(title);language model(abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
专题命中 长上下文与记忆 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments ICLR'23 Camera Ready
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL
LLM代理中的外部化:内存、技能、协议和Harness工程的统一综述
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文综述了LLM代理中从模型权重到上下文再到Harness的演变,探讨了内存、技能和协议作为外部化形式的协同作用,分析了参数化能力与外部化能力的权衡及未来发展方向。
Comments 54 pages, tech report on Externalization in LLM Agents
通过结构化内存缓解大型语言模型(LLM)中的过度个性化问题
机构 * University of Saskatchewan(萨斯喀彻温大学) ; University of California–Irvine(加州大学欧文分校) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Obra D. Tompkins High School(奥布拉·D.汤普金斯高中)
专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI
AI总结 该研究针对内存增强LLM的跨域泄漏和内存诱导谄媚问题,提出推理时按领域划分内存的结构化呈现方法,在PersistBench七个模型上平均降低8.8%跨域泄漏且保持实用性。
通过迭代优化从隐式交互流中学习动态用户画像
机构 * PayPal(贝宝)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 针对现有个性化LLM依赖显式偏好监督的局限,提出IRIS框架,通过隐式交互流迭代优化用户画像,在Reddit AITA数据上的100位作者测试中,其决策预测准确率达61.0%,优于多种基线方法。
Comments 23 pages, 1 figure, 3 tables
大语言模型中的现实监测:随对话记忆而转变的自我认知
机构 * University of Florida(佛罗里达大学) ; University of Missouri(密苏里大学)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 研究大语言模型中现实监测能力,通过两个实验和六个模型发现来源归因依赖对话记忆结构,反馈揭示模型存在内部外部判断互换、置信度与正确性脱钩等问题,表明评估模型知识时追踪来源很重要。
大规模提示设计:格式、指令数量和上下文长度如何影响大语言模型中的指令遵循和幻觉
机构 * Machine Human Intelligence Lab (MHIL)(机器人类智能实验室)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 研究大语言模型提示设计中格式、指令数量和上下文长度对指令遵循及幻觉的影响,通过在合成语料库上的两个控制实验评估五个模型,揭示了不同因素下的表现及规律,还发布了相关工具和结果。
Comments 21 pages, 6 figures. Code and data: https://github.com/iNetanel/veyrabench
感知与敏感性:探讨语义回忆对长上下文代码推理的影响
机构 * Columbia University(哥伦比亚大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。
Comments Accepted to ACL 2026 (main)
通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴
机构 * Peking University(北京大学) ; DeepSeek-AI
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。
PARTREP: 学习在仅解码器LLM中重复什么
机构 * Bandung Institute of Technology(万隆理工学院) ; Pohang University of Science and Technology(浦项科技大学)
专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);分类 cs.CL、cs.LG
AI总结 针对仅解码器LLM因果注意力导致的信息流不对称问题,提出PartRep方法,通过选择最不可预测的token进行重复,在保留大部分性能提升的同时显著降低KV缓存和预计算开销。
Comments 15 pages and 7 figures (including appendix)
子令牌路由用于KV缓存压缩
机构 * Futurewei Technologies(未来智科)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。
Comments 17 pages, 8 tables, 2 figures
G-Long:面向高效长期对话代理的图增强记忆管理
机构 * Sungkyunkwan University(成均馆大学)
专题命中 长上下文与记忆 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 提出G-Long框架,利用微调小语言模型进行结构化三元组提取和关联检索,并引入注意力感知重要性评分机制,在降低计算开销的同时,在响应生成和记忆检索上达到最优性能。
Comments 22 pages, 8 figures, 14 tables
AMA-Bench:评估智能体应用的长时记忆
机构 * UCSD(加州大学圣塔克拉拉分校) ; Recursive
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出AMA-Bench基准,通过真实与合成轨迹评估LLM智能体的长时记忆,并基于因果图与工具增强检索提出AMA-Agent系统,在基准上提升11.16%准确率。
多跳问答中的故障模式:最弱链接效应与识别瓶颈
机构 * University of Cambridge(剑桥大学)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究揭示多跳问答中LLM因位置偏见导致的识别与综合失败机制,提出MFAI方法解决识别瓶颈,提升低可见性位置准确率,并展示系统2推理模型在长上下文中的有效性。
Comments Accepted at ACL 2026
每个token都重要:在大语言模型中推广1600万超长上下文
机构 * Ant Group(蚂蚁集团) ; Westlake University(西湖大学)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本文提出了一种新型的分层稀疏注意力机制,用于在大语言模型中实现对超长上下文的有效建模,并在多个任务中展示了其处理1600万长度上下文的能力。
机构 * Apple(苹果公司) ; Fudan University(复旦大学)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Accepted by NeurIPS 2025
机构 * Peking University(北京大学) ; Tianjin University(天津大学) ; Tencent(腾讯) ; Fudan University(复旦大学)
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
机构 * AMD ; UC San Diego(加州大学圣地亚哥分校)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Published at ACL 2025 Main Conference
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
Journal ref Pattern Recognition, Volume 162, 2025, Article 111332
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Accepted by ACL 2024 (main conference, long paper)
演化技能结构攻击记忆增强大语言模型越狱
专题命中 长上下文与记忆 :LLM(title,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出MemAttack框架,通过技能结构化的攻击记忆建模、生命周期驱动的记忆演化和探索-利用平衡的记忆选择,实现高效的黑盒越狱攻击,在AdvBench上达到98.00%攻击成功率。
Comments Under review