Regularization and nonlinearities for neural language models: when are they needed?
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG
Comments Added new experiments on large datasets and on the Microsoft Research Sentence Completion Challenge
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG
Comments Added new experiments on large datasets and on the Microsoft Research Sentence Completion Challenge
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL
Journal ref Proceedings of SIGIR 2005, pp. 306--313
专题命中 长上下文与记忆 :SLM(title,abstract)
Comments 31 pages, 11 figures, 5 tables. The associated R package 'slm' is available on the CRAN website (https://cran.r-project.org/index.html) or on the GitHub website (https://github.com/E-Caron/slm)
Journal ref The R Journal, 13(1):83-100, June 2021
信息丰度悖论:长上下文训练会破坏参数化知识
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出信息丰度悖论,发现长上下文训练会使模型减少参数化知识编码、增加对上下文的依赖,预训练和微调中均存在性能先升后降或鲁棒性降低的现象,表明近无穷大上下文缩放并非仅靠更多数据。
何时潜在通信能发挥作用?多智能体大语言模型中中继键值缓存的因果审计
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究通过因果审计多智能体LLM的中继KV缓存,发现仅当接收方需要发送方私有信息时,潜在通信才会发挥作用,且不匹配缓存审计是验证潜在想法传输的必要手段。
MemSFT:使用外部参数内存减轻对齐代价
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。
Comments 33 pages, 11 figures, 13 tables
WebCoach:具有跨会话记忆引导的自我进化网络代理
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。
Comments 18 pages
一种用于智能体编排的形式化分层架构,基于栈的执行和惰性发现
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体架构瓶颈,提出分层基于技能的编排架构,通过LIFO栈和惰性发现协议解决问题,防止输出泄漏,并进行数学形式化、算法分析及基准测试,为企业环境部署提供隔离保证。
评估检索增强生成与长上下文输入用于电子健康记录临床推理的效果
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Loyola University Chicago(芝加哥洛约拉大学) ; Boston Children’s Hospital Harvard Medical School(波士顿儿童医院哈佛医学院) ; University of Colorado-Anschutz(科罗拉多大学安舒茨分校)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究评估检索增强生成(RAG)用于电子健康记录临床推理的效果,定义三个基于EHR的任务,用真实住院临床记录评估三种大语言模型,发现RAG在成像程序和抗生素时间线任务中令牌效率高,诊断生成任务较具挑战性,RAG是临床任务的有效方法。
通过激活聚合进行提示压缩
机构 * Freie Universität Berlin(柏林自由大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨能否将指令提示的任务相关信息压缩成单个激活向量注入模型,利用中间层激活的学习加权和实现了这一点,压缩向量保留关键信息且准确率下降小,还揭示了语言模型激活空间的结构。
正确实现分层稀疏注意力:迈向无限上下文建模
机构 * Tencent HY Team(腾讯混元团队) ; ShanghaiTech University(上海科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 研究如何解决现代大语言模型扩展到长上下文时的计算成本和注意力长度外推问题。提出分层地标稀疏注意力机制,通过语言模型损失端到端学习块选择,实现高效长上下文建模。
Comments preprint
荷马:通过分层记忆和智能推理理解长视频
机构 * Soochow University(苏州大学) ; Tencent Hunyuan Multimodal Department(腾讯混元多模态部)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究长视频理解问题,提出荷马分层在线记忆探索与推理框架,其记忆反映视频多尺度结构,智能推理器按人类方式探索记忆,通过多轮检索组合答案,性能优于此前最佳方法。
Comments under review
用于特征发现和长上下文归因的轮次平均稀疏自编码器
机构 * Anthropic Fellows Program(Anthropic 合作者计划) ; Anthropic
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出轮次平均稀疏自编码器,通过重构轮次平均激活来固定特征数量,简化长上下文下的特征归因与解释。
如何训练长上下文视觉文档模型
机构 * LightOn
专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 本文研究长上下文视觉语言模型的训练方法,通过系统分析预训练、监督微调和偏好优化,实现MMLongBenchDoc上的最佳性能,并发现匹配评估上下文长度的训练效果更优。
GateMem:多主体共享内存代理中的内存治理基准
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; King Abdullah University of Science and Technology (KAUST)(卡尔斯鲁厄大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.LG
AI总结 提出GateMem基准,评估多主体共享内存代理在效用、访问控制和遗忘三方面的治理能力,发现现有方法无法同时满足三者。
Comments 24 pages, 8 figures. Code and dataset are available at https://github.com/rzhub/GateMem and https://huggingface.co/datasets/Ray368/GateMem
个性化陷阱:用户记忆如何改变大语言模型的情感推理
机构 * Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究用户记忆如何导致大语言模型在情感推理中产生系统性偏差,发现高绩效模型对优势背景用户的情感解读更准确,个性化机制可能嵌入社会等级。
Comments 19 pages 5 figures
贡献权重:自注意力Transformer的几何分析
机构 * University of Cambridge(剑桥大学)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。
从模型扩展到系统扩展:扩展智能体AI中的“缰绳”
机构 * UC Berkeley(伯克利大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。
更长的时间上下文如何增强大脑对多模态叙事视频的处理?
机构 * Technische Universität Berlin(柏林技术大学) ; Microsoft Research(微软研究院) ; IIT Delhi(德里理工学院) ; Microsoft(微软) ; IIIT-Hyderabad(海得拉巴理工学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。
Comments 22 pages, 15 figures
缓解多轮代理中的对话惯性
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) ; University of Rochester, Rochester, NY, USA(罗切斯特大学)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了多轮代理中对话惯性问题,提出通过上下文偏好学习来校准模型偏好,以减少惯性并提升性能。
Comments ICML2026
一种更像单词的图像标记化方法用于大规模语言模型
机构 * Seoul National University(首尔国立大学) ; Ewha Womans University(成均馆大学)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种解耦视觉标记化方法(DiVT),通过将图像块嵌入聚类为语义单元,使每个标记对应于独特的视觉概念,从而提升多模态模型的性能和效率。
Journal ref Proceedings of the IEEE/CVF International Conference on Pattern Recognition and Computer Vision (CVPR), 2026
分层可变性:持续性与治理在持久自修改代理中的作用
机构 * Kamiwaza AI
专题命中 长上下文与记忆 :pretraining(abstract);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 本文提出分层可变性框架,分析持久自修改代理中行为持续性和治理挑战,指出突变速度、下游耦合强度、可逆性弱和可观测性低会导致层间不匹配,主要贡献是揭示了自修改代理的失效模式是组合漂移而非突变对齐。
Comments 17 pages, 2 figures, 3 tables. self-modifying agents; AI governance; identity drift; persistent memory; runtime adaptation; model editing Primary: cs.AI Cross-list: cs.LG, cs.CY
记忆 inception:用于引导 LLMs 的潜在空间 KV 缓存操作
机构 * Yale University(耶鲁大学) ; Princeton University(普林斯顿大学) ; Jump Trading
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 本文提出 memory inception 方法,通过在选定层插入文本衍生的键值对(KV)银行,在潜在注意力空间中引导 LLMs,实现更高效的控制与更少的存储消耗。
MemRouter: 基于记忆嵌入的路由机制用于长期对话代理
机构 * University of Central Florida(佛罗里达大学中央分校) ; University of Rochester(罗切斯特大学) ; University of Illinois at Chicago(伊利诺伊大学香槟分校) ; Case Western Reserve University(凯斯西储大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 MemRouter通过嵌入路由策略优化长期对话代理的记忆存储,相比传统方法提升了存储效率并降低了延迟,验证了小型监督路由器在记忆准入中的有效性。
EngramaBench:基于结构化图检索评估长期对话记忆
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文提出EngramaBench基准测试,评估长期对话记忆系统在事实回忆、跨空间整合等任务中的表现,对比Engrama与GPT-4o和Mem0的性能差异。
Comments 9 pages, 2 figures, 3 tables
潜在偏好建模用于跨会话个性化工具调用
机构 * Hanyang University(翰阳大学)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MPT基准和PRefine方法,通过生成-验证-细化循环提升工具调用准确性,仅用1.24%的token实现稳健的个性化。
Comments Under review. 25 pages, 10 figures, 16 tables
深度优化状态:通过交错卸载实现变压器模型的可扩展训练
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Illinois Institute of Technology(伊利诺伊理工学院) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出深度优化状态技术,通过交错卸载优化器状态到主机内存,提升GPU和CPU的利用效率,实验显示比现有方法快2.5倍。
从一叠起:多尺度自我注入用于上下文窗口扩展
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) ; Singapore Management University (SMU)(新加坡管理大学) ; Nanyang Technological University (NTU)(南洋理工大学) ; National University of Singapore (NUS)(新加坡国立大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出多尺度自我注入框架,通过压缩和查询感知信息获取扩展上下文窗口,实现高效且准确的长上下文处理。
Comments 20 pages, 6 figures
Nirvana:一种具有任务感知内存机制的专用通用模型
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Xiong’an Anying Technology Co., Ltd.(雄安安影科技有限公司) ; Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 Nirvana提出一种具备任务感知内存机制的专用通用模型,通过线性时间复杂度和测试时任务信息提取,在通用和专业领域均表现优异,尤其在医学、金融和法律等专业领域实现最低困惑度。
认知分歧:人工智能上下文窗口、人类注意力下降与委托反馈循环
机构 * Machine Human Intelligence Lab (MHIL)(机器人类智能实验室 (MHIL))
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了人工智能上下文窗口扩展与人类持续注意力能力下降之间的自我强化动态,提出认知分歧概念,并探讨委托反馈循环对人类认知能力的影响。
Comments 28 pages, 1 figure, 5 tables. Preprint, not peer reviewed