BlockLLM: Memory-Efficient Adaptation of LLMs by Selecting and Optimizing the Right Coordinate Blocks
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 18 pages, 7 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 18 pages, 7 figures
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments EACL (main)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
ATMA: 通过极坐标注意力与门控-增量压缩记忆实现长度不变的语言建模
机构 * Kreasof AI
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出ATMA混合卷积-注意力架构,通过极坐标注意力三通道分解和门控-增量递归压缩记忆,解决长上下文语言建模中注意力稀释和性能崩溃问题,实现训练长度32倍外推下90%以上检索准确率和单调递减困惑度。
用于剩余使用寿命估计的时间序列基础模型嵌入
机构 * University of Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) ; Siemens AG(西门子股份公司)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出冻结预训练时间序列基础模型Chronos-2作为骨干,结合轻量回归头进行剩余寿命预测,在工业传感器数据上优于多种基线方法。
Comments Accepted to EUSIPCO 2026, 4 pages, 2 figures, 2 tables
分层位置偏倚在短上下文语言建模中的表现
机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究院,卡坦大学,伊朗) ; School of Electrical and Computer Engineering, University of Tehran, Iran(德黑兰理工大学电气与计算机工程学院,伊朗)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出一种基于归因的框架,分析短上下文语言建模中各层的位置偏倚,发现深度增加时近期偏倚增强,首次偏倚减弱,且早期层更倾向内容词。
干扰项感知截断:在长上下文大语言模型基准测试中分离上下文长度效应与信号损失
专题命中 长上下文与记忆 :LLM(title);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过对比两种截断协议测试长上下文基准,发现朴素截断的性能下降源于信号丢失,干扰项感知截断可保留性能,强调需明确区分信号与干扰项以研究上下文长度效应。
Comments 14 pages, 2 figures. Code and data: https://github.com/evolutionIdGmbH/memoreach
Metis:记忆基础模型
机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。
Comments 46 pages, 11 figures, 16 tables
ReToken:用一个标记改进用于视觉检索的视觉-语言模型
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出轻量级ReToken,通过选择视觉键值缓存中与查询相关的稀疏标记解决长视觉上下文的视觉检索难题,在多基准测试中提升Qwen3VL-8B等模型性能,且可在单H100运行。
Comments Code: https://github.com/avaxiao/ReToken
面向长上下文语言模型的可合并模型侧聚合状态
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对长上下文语言模型在非加性集合聚合任务中的性能缺陷,提出带HLL草图状态的模型侧聚合接口,该接口可合并跨段状态,在多任务上较基线方法实现显著性能提升。
一致性门控:通过自一致性准入控制防止大语言模型智能体中的内存污染
机构 * Florida State University(佛罗里达州立大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型智能体内存污染问题,提出一致性门控方法,在提交候选事实前向模型查询K次获软支持分数,超阈值才准入。该机制与模型无关、无需微调,经实验在四个模型主干上减少了污染,还发布了相关基准和实现。
Comments 24 pages, 2 figures, 6 tables, 1 algorithm; includes appendices
模块各司其职吗?复合语言模型系统中的角色漂移
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究复合语言模型系统中模块的角色漂移问题,提出角色锚定正则化方法,通过实验揭示仅准确性无法检测的角色漂移,该方法能以可调成本减轻漂移,且减少与角色漂移方向的对齐,而非简单抑制学习。
AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Toronto(多伦多大学) ; Google(谷歌公司) ; Stanford University(斯坦福大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。
一种机制用于多种心理空间:语言模型中基于值槽的共享路由器
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究Transformer语言模型实现何种心理空间构建机制,发现其采用共享路由器和值槽格式,一种空间类型子空间训练能控制其他类型,确立跨类型通用性,还表明该机制驱动推理和组合。
Comments 26 pages, 5 figures, 9 tables. v2: cite the released Mental Spaces Corpus (dataset DOI); switch to ACL bibliography style; minor copy-editing. No change to results
持久稀疏自动编码器:在语言模型中学习特征时间尺度
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究在语言模型中学习特征时间尺度的问题,提出持久稀疏自动编码器,通过为特征学习持久性系数扩展标准SAEs,实验表明其能保持竞争力的重建质量,为解释和监测语言模型带来新机会。
循环中的记忆:进程内检索作为语言智能体的扩展工作记忆
机构 * Stevens(史蒂文斯理工学院)
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.CL、cs.AI
AI总结 研究语言智能体中记忆进入循环的情况,通过对比网络存储和进程内存储的延迟,利用扩展思维理论提出进程内检索可作扩展工作记忆,经实验验证能提升召回率,还重新定位了操作瓶颈。
缓存感知提示压缩:用于大语言模型API缓存的双层成本模型
机构 * PayPal Inc.(贝宝公司)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型API缓存成本,发现现有方法不足。提出缓存感知提示压缩(CAPC),结合查询无关压缩与缓存控制。经实验验证,CAPC在多种配置下成本最低,在生产工作负载中表现出色,验证了交叉模型负投资回报率预测。
Comments 28
追踪、排序、决断:认知工作记忆对语言智能体中的多跳推理进行衡量
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI、cs.LG
AI总结 研究语言智能体多跳推理链变长性能下降问题,提出SLEUTH方法通过结构化认知工作记忆提升推理,经实验优势随难度增加,还发现证据充分性问题及解决办法,表明组织推理方式是扩展多跳推理关键。
用记忆进行推测:大语言模型智能体的无损加速
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.LG
AI总结 研究旨在加速大语言模型智能体,提出为推测器配备三个在线记忆系统,通过从智能体过去轨迹学习提升预测质量。经六个基准测试,记忆增强推测在动作和观察预测上有显著提升,且无损并能跨模型推广。
RCWT:从大语言模型调用中的协调内容测量任务预算位移
机构 * CloudWalk, Inc.(云从科技集团股份有限公司)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究多智能体和内存增强大语言模型中协调内容占用任务预算的问题,提出RCWT测量协议,通过改变协调内容等控制变量进行实验,发现模型表现受影响,该测试是上下文分配预算测量原语,但非多智能体收益等完整理论。
Comments 10 pages, 1 figure
ResonatorLM:用于高效长上下文语言模型的因果共振场混合
机构 * Axionic Labs(轴子实验室)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对Transformer等模型处理长上下文效率低的问题,提出ResonatorLM机制,将令牌序列视为潜场,用阻尼谐振器因果函数替代注意力点积,在传统架构上实现并测试,取得训练和预填充加速、高解码速度及准确率提升等成果。
Comments 8 Pages. Accepted at ICANN 2026
用于具有投影视图和经过验证的结构化更新的共享状态大语言模型工作流的PatchOptic
机构 * Weizmann Institute of Science(魏茨曼科学研究所) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究共享状态大语言模型工作流问题,提出受光学启发的PatchOptic接口,通过投影读取和验证结构化补丁实现,经PatchBench评估,该设计能减少泄漏和成本,保持输出质量,阻止违规并拒绝受损补丁。
Comments 24 pages, 13 figures, including appendix
从张量缓冲区到分布式内存层次结构:大语言模型服务中键值缓存管理综述
机构 * Texas Tech University Department of Computer Science(德克萨斯理工大学计算机科学系)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 综述通过四个轴对三十多个键值管理系统和框架分类,揭示五种架构原型,还审计当前评估,找出七个缺失测量,关联容错等开放问题。
稀疏层对扩展循环语言模型至关重要
机构 * USC Information Sciences Institute(美国南加州大学信息科学研究所) ; Netflix(netflix公司)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究比较了带循环和不带循环的MoE和标准Transformer,发现循环MoE模型在扩展性上优于标准模型,且循环模型在计算质量权衡中具有更好的早退性能。
Harmonic: 用于高效长上下文语言建模的分层状态空间模型
机构 * Independent Researcher(独立研究员)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出分层状态空间模型Harmonic,通过堆叠三个不同时间尺度的循环层,每层接收下层预测误差而非原始隐藏状态,在长序列上显著优于Transformer和Mamba,并消除了RoPE位置编码限制。
Comments 12 pages, 8 figures. NeurIPS 2024 format
TS-Memory: 时间序列基础模型的即插即用记忆模块
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Tencent(腾讯) ; Squirrel Ai Learning ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出参数化记忆蒸馏方法TS-Memory,通过轻量级记忆适配器增强冻结的时间序列基础模型,在分布偏移下实现无检索的高效零样本预测,显著提升点预测和概率预测性能。