Loop the Loopies!
循环循环者!
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
循环循环者!
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
改进 cascaded 在线学习飞行控制系统中的动作平滑性
机构 * Section Control and Simulation, Faculty of Aerospace Engineering, Delft University of Technology(控制与仿真部门,航空航天工程学院,代尔夫特理工大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI
AI总结 本文提出在线时间平滑技术与低通滤波器以提升飞行控制系统动作平滑性,通过FFT分析策略性能,验证了方法的有效性。
Sign-SZPO:具有未知链接函数的基于可证明偏好的强化学习
机构 * University of Michigan(密歇根大学)
专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG
AI总结 研究具有未知链接函数的基于偏好的强化学习问题,提出Sign-SZPO零阶策略优化算法,该算法仅估计价值函数差的符号来构建更新方向,可证明收敛到平稳策略,实证显示其在链接函数错误指定下具有鲁棒性。
长期记忆中的不安全编码偏好:基于大语言模型的代码生成的安全风险
专题命中 长上下文与记忆 :LLM(title,summary_cn)
AI总结 研究基于LLM的代码生成中,长期记忆里不安全编码偏好带来的安全风险,通过评估四种LLM在五种编程语言上的表现,发现其显著增加生成漏洞代码风险及存在警告差距,还评估了三种缓解策略并给出改进安全性的建议。
Comments Accepted to the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)
VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解
机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。
从盲目搜索到内存感知进化:通过协作诊断和效用感知检索实现高效数据库管理系统调优
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 针对多组件DBMS调优难题,EvoTune框架通过协作诊断定位高影响子空间,引入效用感知检索策略,将调优反馈组织成层次化内存,无需LLM微调,实验证明其性能优于现有基线,能快速提升查询性能。
持久稀疏自动编码器:在语言模型中学习特征时间尺度
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究在语言模型中学习特征时间尺度的问题,提出持久稀疏自动编码器,通过为特征学习持久性系数扩展标准SAEs,实验表明其能保持竞争力的重建质量,为解释和监测语言模型带来新机会。
循环中的记忆:进程内检索作为语言智能体的扩展工作记忆
机构 * Stevens(史蒂文斯理工学院)
专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.CL、cs.AI
AI总结 研究语言智能体中记忆进入循环的情况,通过对比网络存储和进程内存储的延迟,利用扩展思维理论提出进程内检索可作扩展工作记忆,经实验验证能提升召回率,还重新定位了操作瓶颈。
AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造
机构 * The University of Hong Kong(香港大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。
从记忆到技能:基于证据的长期大语言模型智能体协同进化治理
机构 * University of Science and Technology of China(中国科学技术大学) ; Hong Kong Polytechnic University(香港理工大学) ; Fuzhou University(福州大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL
AI总结 针对长期大语言模型智能体记忆系统问题,提出无需训练的MSCE框架,将经验组织为多种形式,把证据支持的策略转化为可调用技能,引入反射加权值回填,实验证明其性能优于基线,有跨域转移性和终身进化能力。
Comments Submitted into EMNLP'2026
RECON:用于长上下文组合推理的智能体内存基准测试
机构 * RV College of Engineering(RV工程学院) ; Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究引入RECON基准测试,用于评估长上下文组合推理,跨越三个领域24个案例文件,测试智能体六个内存密集型任务,揭示当前架构在内存相关任务上存在重大局限,非预言机系统准确率低,检索和推理有挑战。
Comments 25 pages
NEMO: 通过自主编码代理实现执行感知的优化建模
机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)
专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。
Comments Accepted at ICML 2026
SWE-Pruner Pro:编码语言模型已知道该修剪什么
专题命中 长上下文与记忆 :LLM(title);分类 cs.CL
AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。
Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro
SALT:用于长上下文压缩的显著性感知词汇字典树
机构 * Florida State University(佛罗里达州立大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大语言模型处理长提示时的计算和内存瓶颈,提出SALT框架,将句子关键词组织成按句子频率排序的字典树,通过多锚点检索等方式保留文档主题,降低长上下文提示的预填充成本,还可与KV缓存方法结合。
RoVE: 旋转值嵌入注意力实现相对位置相关的值路径
机构 * AMLab University of Amsterdam(阿姆斯特丹大学AMLab) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出RoVE方法,通过同时旋转键和值使值对位置敏感,将RoPE注意力转化为注意力卷积,在少样本学习、分布外困惑度和长上下文检索上优于RoPE。
使用Transformer进行规划:计算链与结构化上下文窗口
机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算科学系) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究大语言模型解决规划问题的不足,提出计算链架构,利用结构化上下文窗口,让语言模型学习规划策略、预测世界模型并执行算术运算,在多个任务上取得高成功率,能解决复杂汉诺塔问题且减少训练数据。
SelKV:基于逐令牌合并或丢弃及注意力补偿的选择性键值缓存合并
机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大型语言模型KV缓存内存占用瓶颈问题,提出无训练的SelKV双组件框架,通过软余弦门和注意力比率补偿机制进行缓存压缩,在LongBench数据集上仅保留25%缓存时性能强大,在多文档问答任务中表现出色且解码加速。
无迹可循:低秩训练中的不可识别性与优化器状态
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究低秩训练中优化器子空间不可识别性问题,发现不同小批量计算的子空间估计差异大,平均无法恢复其余方向。提出将刷新视为坐标变化,如LDAdam表现良好,还明确了GaLore有效原因及相关检查要点在于可重现秩k*。
Comments 21 pages, 5 figures, under review at ICOMP2026
HiCI:层次化构造-整合用于长上下文注意力
机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) ; Westlake University(西湖大学)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 HiCI通过层次化构造-整合模块,提升长上下文注意力模型的性能,通过参数高效适应LLaMA-2,将上下文长度扩展至10万和6.4万token,并在多个基准测试中超越现有模型。
Comments 20 pages, 5 figures
ZifaMem:人工智能伴侣中用于人物形象、偏好和情感连续性的结构化记忆
机构 * ZifaCorp(紫发公司) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究针对人工智能伴侣情感连续性问题,提出结构化记忆系统ZifaMem,通过组织对话形成多种记忆模型。实验表明其能提升情商得分、改善人物形象基础等,多种记忆系统均有改善,且ZifaMem与Mem0在主要偏好端点统计等效,相关工具已开源。
并行解码器Transformer:规划引导的潜在协调用于同步并行解码
机构 * Independent Researcher(独立研究者)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI
AI总结 并行解码器Transformer通过规划引导的潜在协调机制,实现模型内部的同步并行解码,提升多任务生成效率。
Comments Note: Updated to reflect revised architecture
探索性与同化性反思:用于长期记忆的反思性回忆循环
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI
AI总结 研究基于大语言模型的自主智能体外部记忆问题,提出探索性 - 同化性反思(EAR)框架,结合探索性反思与同化性反思两种机制,提高初始检索性能和样本效率,在长期对话基准上比基线检索器提升检索率达 17.9%,且样本效率高、抗噪声反馈。
SynH-Rank:通过多样化数据合成和分层排序训练实现质量感知代码搜索
机构 * College of Computer Science and Technology(计算机科学与技术学院) ; The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Zhejiang University(浙江大学) ; Hangzhou City University(杭州市城市大学) ; Zhejiang University and Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(浙江大学和杭州高新区(滨江)区块链与数据安全研究院)
专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL
AI总结 研究针对代码搜索中重排器忽视非功能质量的问题,提出SynH-Rank框架,结合大语言模型数据合成与分层排序训练,采用三级标注方案及新指标,有效提升了代码搜索质量,在多方面取得优于传统方法的性能。
用于主动具身安全的自进化即时记忆
机构 * Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG
AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。
VLN-AVP:用于自动代客泊车的基于混合长短时记忆的零样本视觉语言导航
机构 * Shanghai Jiao Tong University(上海交通大学) ; Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 研究针对自主代客泊车依赖预建地图限制可扩展性问题,提出VLN-AVP零样本导航框架,结合BEV模型与VLM,引入混合记忆系统,构建数据集和基准,实验证明该方法在模拟和实际车辆实验中均有良好效果,提升了成功率。
用于无训练测试时医学图像分割的内存支持协同适应
机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。
Comments 18 pages, ECCV 2026
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Road Transport Development Center(上海市道路运输发展中心) ; Hunan Institute of Advanced Technology(湖南先进技术研究院)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。
Comments Accepted by ACM Multimedia 2026
HyperDCM:用于跨场景连续机器人导航的双曲空间动态集群记忆回放
机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) ; School of Geospatial Information, Information Engineering University(信息工程大学地理空间信息学院) ; University of Shanghai for Science and Technology(上海理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 针对视觉导航持续学习难题,提出HyperDCM,通过场景图建模和记忆回放增强导航。利用视觉语言模型提取三元组,经R-GCN编码投影到双曲空间,采用动态聚类等策略。实验证明其在保留导航能力和泛化性上优于基线。
心电图大语言模型:基于心电图的心脏推理基础模型
专题命中 推理与问题求解 :LLM(title,summary_cn);foundation model(title);large language model(abstract);language model(abstract)
AI总结 研究针对一线分诊缺乏确定性成像及现有心电图人工智能系统局限的问题,提出ECG-LLM模型,用多模态到语言监督策略训练,能从心电图回答多样心血管问题,恢复测量值、预测表型,在相关任务中表现良好,为临床推理提供支持。
奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。
Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation