Recurrent Action Transformer with Memory
具有记忆的递归动作变换器
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出具有记忆的递归动作变换器(RATE),通过引入递归记忆机制提升离线强化学习中对长序列和内存密集型任务的处理能力。
Comments 29 pages, 22 figures, 13 tables
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
具有记忆的递归动作变换器
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出具有记忆的递归动作变换器(RATE),通过引入递归记忆机制提升离线强化学习中对长序列和内存密集型任务的处理能力。
Comments 29 pages, 22 figures, 13 tables
PlugMem: 一种通用插件记忆模块用于LLM代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Microsoft Research(微软研究院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 PlugMem是一种通用记忆模块,通过知识中心的记忆图结构提升LLM代理在复杂任务中的记忆检索与推理能力。
下一步嵌入预测使世界模型更强大
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。
可信治理:在弱真相信号下的一种社会机制,用于集体自我校正
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 可信治理通过动态可信度评分和可信度加权背书,提升集体自我校正能力,减少虚假信息影响。
LLM 自我解释失效语义不变性
机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 LLM自我解释在语义上下文变化时无法保持稳定,表明其无法可靠反映模型内部状态或能力。
回望以推导前行:用于长上下文LLM代理的可回溯记忆
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; DP Technology(DP科技) ; Meituan(美团)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 ReMemR1通过整合记忆检索机制和多级奖励设计,提升长上下文问答任务的推理能力与效率。
自适应相关加权内在奖励用于强化学习
机构 * Institute for Artificial Intelligence(人工智能研究所) ; VNU-University of Engineering and Technology(越南工程与技术大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 ACWI通过自适应相关加权内在奖励机制提升稀疏奖励强化学习中的探索效率和样本效率。
Hello-Chat: 向真实社交音频交互迈进
专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI、cs.CL
AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。
上下文记忆虚拟化:基于DAG的状态管理和结构无损修剪用于LLM代理
机构 * Imperial College London(伦敦帝国学院)
专题命中 记忆与上下文管理 :tool-use(abstract);分类 cs.AI、cs.SE
AI总结 上下文记忆虚拟化通过DAG结构管理和无损修剪技术,提升LLM代理在长期推理任务中的上下文重用效率和经济性。
Comments 11 pages. 6 figures. Introduces a DAG-based state management system for LLM agents. Evaluation on 76 coding sessions shows up to 86% token reduction (mean 20%) while remaining economically viable under prompt caching. Includes reference implementation for Claude Code
部分可观测环境中的时序知识图谱记忆
机构 * HumemAI ; Vrije Universiteit Amsterdam(范·艾克大学阿姆斯特丹) ; ELLIS Institute Finland & Abo Akademi University(芬兰ELLIS研究所及阿博阿卡迪米大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种基于时序知识图谱的记忆机制,通过在部分可观测环境中测试,展示了符号智能体在QA任务中比神经基线高出四倍的准确率。
结构对齐的子任务级记忆用于软件工程代理
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出结构对齐的子任务级记忆方法,通过与代理功能分解对齐来提升软件工程代理的长周期推理能力,实验表明在多种backbone上均优于传统方法。
关于观察与语义的动力学
机构 * Bytedance Seed(字节跳动种子)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出智能是物理可实现的代理属性,通过语义常数 B 限制信息处理复杂性,强调语言和逻辑是本体论必要性。
基于记忆的优势塑造用于LLM引导的强化学习
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于记忆的优势塑造方法,通过构建记忆图来提升LLM引导强化学习的样本效率和学习速度,减少对连续LLM监督的依赖。
Comments Association for the Advancement of Artificial Intelligence (AAAI)
AutoWebWorld: 通过有限状态机合成无限可验证的网页环境
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Peking University(北京大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE
AI总结 AutoWebWorld通过有限状态机合成可验证的网页环境,实现自动化搜索与验证流程,提升WebGUI代理性能。
KernelBlaster: 通过记忆增强的上下文强化学习实现持续的跨任务CUDA优化
机构 * NVIDIA ; University of California, Berkeley(加州大学伯克利分校)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 KernelBlaster通过记忆增强的上下文强化学习框架提升CUDA代码优化性能,实现跨多个GPU架构世代的高效优化。
Comments 15 pages, 33 pages with appendix
选择如何记忆:面向LLM代理的自适应记忆结构
机构 * University of Technology Sydney(悉尼大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; The University of Melbourne(墨尔本大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FluxMem框架,通过自适应记忆结构选择和三级记忆层次结构,提升LLM代理在长时间交互中的表现,实验显示平均提升9.18%和6.14%。
务实型机器人:通过体验现实世界学习任务规划
机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ; ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) ; Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) ; UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率
Comments Accepted to RA-L
利用集成误差的值奖金用于强化学习中的探索
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 VBE通过集成误差设计价值奖金,实现强化学习中的首次访问乐观性和深度探索,优于现有方法。
Comments Accepted at Reinforcement Learning Conference (RLC) 2025
Journal ref Reinforcement Learning Journal, vol. 6, 2025, pp. 1894-1915
无状态却非遗忘:隐式记忆作为LLM中的隐藏通道
机构 * Microsoft Security Response Center (MSRC)(微软安全响应中心) ; ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根ELLIS研究所和智能系统研究所) ; Tübingen AI Center(图宾根人工智能中心)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究提出隐式记忆机制,使LLM在无显式存储的情况下通过输出编码信息实现跨交互状态传递,展示其在时间炸弹等安全问题中的应用及影响。
Comments Accepted at IEEE SaTML 2026
MemPot:通过优化的陷阱来防御内存提取攻击
机构 * National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; Southern University of Science and technology(南方科技大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。
从开普勒到牛顿:归纳偏置引导变换器中的学习世界模型
机构 * Stanford University(斯坦福大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文通过引入归纳偏置,使通用变换器能够学习世界模型,从开普勒到牛顿,实现从曲线拟合到物理定律发现的转变。
Memento 2: 通过状态化反思记忆进行学习
机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 Memento 2通过状态化反思记忆机制,实现无需参数更新的持续学习,提升代理在开放任务中的泛化能力。
Comments 35 pages, four figures
通过扩散贝叶斯探索动态修正错误状态估计
机构 * University of Bristol(布里斯托大学) ; Loughborough University(洛桑大学)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种扩散驱动的贝叶斯探索框架,用于动态修正早期状态估计误差,通过熵正则化采样和协方差缩放扩散扩展后验支持,解决S-PSI问题并保持统计严谨性。
在强化学习中,仅依靠记忆保持不足以掌握记忆任务
机构 * Innopolis University(因诺普利斯大学) ; Cognitive AI Systems Lab(认知人工智能系统实验室)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出一个基准测试持续记忆更新,发现经典循环模型在记忆重写任务中表现更优,强调需平衡稳定保留与适应更新的记忆机制。
Comments 11 pages, 6 figures, 7 tables
反思中的反思:将苏格拉底质疑框架整合到基于自动的AI问题生成中
机构 * Czech Technical University in Prague(捷克技术大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出一种基于苏格拉底质疑框架的双代理模型,通过多轮对话生成高质量反思问题,提升教学效果。
设计KRIYA:一种用于幸福感自我反思的AI伴侣
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Drexel University(德雷塞尔大学)
专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.CL
AI总结 KRIYA是一种通过自我反思功能帮助用户理解个人幸福感数据的AI伴侣,旨在减少表现焦虑,提升用户对健康数据的反思性理解。
在自动化定性编码中的自我反思:通过二次LLM批评提升文本标注
专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.CL、cs.SE
AI总结 通过二次LLM批评提升文本标注精度,减少错误率并提高分类器性能。
LLMs可以压缩LLMs:通过代理的自适应剪枝
机构 * Research and Development, Sports Vision, Inc.(研发部,Sports Vision公司) ; Research and Development, Vizworld Inc.(研发部,Vizworld公司)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出通过代理引导的自适应剪枝方法,有效压缩LLMs,提升事实知识保留和模型性能。
Comments 17 Pages
跨领域模仿学习 via 最优传输
机构 * Berkeley AI Research(伯克利人工智能研究)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG
AI总结 GWIL通过Gromov-Wasserstein距离实现跨领域模仿学习,有效对齐不同空间的状态,适用于连续控制领域。
Comments ICLR 2022
超越静态摘要:为LLM代理的主动记忆提取
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) ; National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出ProMem,一种主动记忆提取方法,通过递归反馈机制提升LLM代理的记忆完整性和问答准确性,实现高质量与低成本的平衡。