arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-29 至 2026-06-29 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 25 篇

2606.27719 2026-06-29 eess.SY cs.SY 新提交 50%

Bearing-based Circumnavigation with Collision Avoidance in Time-varying Graphs under Limited Target Information

基于方位的时间变化图中有限目标信息下的环绕与碰撞避免

Kushal Pratap Singh, Twinkle Tripathy, Anoop Jain

专题命中 多智能体 :agent(abstract)

AI总结 针对异构多智能体系统,提出仅利用局部方位信息(通过最近邻交互图)的分布式制导律,实现静止目标环绕并避免碰撞,适用于静态和时变图。

Comments 13 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02827 2026-06-29 cs.RO 版本更新 50%

Orientation Matters: Learning Radiation Patterns of Multi-Rotor UAVs In-Flight to Enhance Communication Availability Modeling

方向至关重要:学习多旋翼无人机飞行中的辐射模式以增强通信可用性建模

Martin Zoula, Daniel Bonilla Licea, Jan Faigl, Václav Navrátil, Martin Saska

机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子工程系) Mohammed VI Polytechnic University(穆莱·伊沙克·博格达特大学)

专题命中 多智能体 :planning(abstract)

AI总结 提出一种通过校准飞行数据学习异构四旋翼无人机天线辐射模式的方法,利用球谐级数或加权平均建模,并通过线性回归解耦独立无人机的辐射模式,在真实数据集上实现4.56 dB RMS外推误差。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12392 2026-06-29 math.OC 50%

Distributed Optimization Algorithm with Superlinear Convergence Rate

具有超线性收敛速度的分布式优化算法

Yeming Xu, Ziyuan Guo, Kaihong Lu, Huanshui Zhang

专题命中 多智能体 :agent(abstract)

AI总结 本文提出一种将分布式优化问题转化为最优控制问题的新算法,利用庞特里亚金极大值原理和正向-反向差分方程,实现无需计算Hessian矩阵逆的二次信息整合,证明了算法的超线性收敛性。

Journal ref Sci China Inf Sci, 2026, 69: 199203

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 11 篇

2606.27611 2026-06-29 cs.LG 新提交 79%

COOPA: A Modular LLM Agent Architecture for Operations Research Problems

COOPA: 面向运筹学问题的模块化LLM智能体架构

Chuanhao Li, Xiaoan Xu, Dirk Bergemann, Ethan X. Fang, Yehua Wei, Zhuoran Yang

机构 * Tsinghua University(清华大学) Duke University(杜克大学) Yale University(耶鲁大学)

专题命中 工作流自动化 :agent(title,abstract);分类 cs.LG

AI总结 提出COOPA模块化LLM智能体架构,通过迭代置信度建模、元素级溯源与多求解器路由,提升运筹问题建模准确性与可解释性,在多个基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27938 2026-06-29 physics.soc-ph 新提交 78%

Students using GenAI lag behind in problem-solving competence: an agent-based study of classroom networks

使用生成式AI的学生在问题解决能力上落后:基于智能体的课堂网络研究

Lorenzo Betti, Iacopo Caporossi, Carsten Källner, Karolina Levanaitė, Chenyu Li, Xuan-Chen Liu, Giulia Lorenzini, Vittoria Socci, Michele Re Fiorentin, Ilaria Stanzani, Marta Baratto

专题命中 工作流自动化 :agent(title,abstract)

AI总结 本研究通过基于智能体的模型模拟高中物理课堂,发现使用生成式AI会削弱学生问题解决能力的发展,并增加低能力层级学生比例。

Comments 21 pages, 16 figures, This work is the output of the workshop Complexity72h by Complexity Next Gen, held at Northeastern University London, London, UK, 22-26 June 2026. www.complexitynextgen.org/complexity72h/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 62%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 62%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27783 2026-06-29 q-bio.NC cs.LG cs.NE 新提交 57%

CANNs: A Toolkit for Research on Continuous Attractor Neural Networks

CANNs:连续吸引子神经网络研究工具包

Sichao He, Aiersi Tuerhong, Shangjun She, Tianhao Chu, Yuling Wu, Junfeng Zuo, Si Wu

机构 * School of Psychological and Cognitive Sciences, Peking–Tsinghua Center for Life Sciences, PKU-IDG/McGovern Institute for Brain Research, Center of Quantitative Biology(心理与认知科学学院,北京清华大学生命科学中心,北京大学IDG/麦克戈文脑科学研究院,定量生物学中心)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 提出统一连续吸引子神经网络(CANN)研究流程的开源工具包,包含Python库、Rust加速后端和吸引子结构分析器,支持从仿真到实验数据分析的完整工作流。

Comments Code: https://github.com/Routhleck/canns ; Rust backend: https://github.com/Routhleck/canns-lib

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28167 2026-06-29 cond-mat.soft cond-mat.stat-mech cs.LG 版本更新 57%

Active-learning mapping of the Vicsek model phase diagram

用机器学习映射Vicsek模型的相图

Grace T. Bai, Brandon B. Le

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯杰斐逊科学与技术高中) Department of Physics, University of Virginia, Charlottesville, Virginia 22904, USA(弗吉尼亚大学物理系,夏洛茨维尔,弗吉尼亚州,22904,美国)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文利用机器学习对Vicsek群体运动模型在三维参数空间(η,ρ,v_0)中的相结构进行分类和插值,通过聚类分析构建相图并提升分类精度。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12001 2026-06-29 cs.DC cs.LG 版本更新 57%

Decentralized Orchestration Architecture for Fluid Computing: A Secure Distributed AI Use Case

去中心化编排架构用于流计算:一个安全的分布式AI应用案例

Diego Cajaraville-Aboy, Ana Fernández-Vilas, Rebeca P. Díaz-Redondo, Manuel Fernández-Veiga, Pablo Picallo-López

机构 * atlanTTic Research Center – ICLAB – Universidade de Vigo(atlanTTic研究所以及ICLAB – 维戈大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种去中心化多域编排架构,用于流计算环境,支持多域协同部署,确保端到端放置和执行。通过引入FU-HST机制提升对抗鲁棒性,验证了多域联邦学习在拜占庭威胁下的性能。

Comments 19 pages, 9 figures and 1 table

Journal ref Computer Networks, Volume 284 (2026) 112369

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28295 2026-06-29 econ.TH 新提交 50%

Equilibrium as a Limit: The Competitive Canon Nested in an Adaptive, Information-Theoretic Economy

均衡作为极限:嵌套在自适应信息论经济中的竞争性经典

Avishek Bhandari

专题命中 工作流自动化 :agent(abstract)

AI总结 本文通过将经济视为自适应信息过程,在显式缩放路径上取联合极限,精确恢复了竞争性理性预期均衡,并证明了该均衡是经典公理体系的一个特例。

Comments EL classification: C62, D58, D80, E10

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28017 2026-06-29 econ.EM stat.ME 新提交 50%

A Toolkit for the Study of Treatment-Effect Discontinuities

处理效应不连续性研究工具包

Alessandro Baldi Antognini, Paolo Verme

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一个工具包,用于研究边际分布效应变号处的处理效应不连续性,包括水平不连续性分析和垂直不连续性分析,并应用交叉点渐近理论定位符号切换点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 50%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28093 2026-06-29 cond-mat.mtrl-sci 新提交 50%

Tuning the optoelectronic properties of wide bandgap perovskites: Data-driven insights from combinatorial synthesis and high-throughput experimentation

调谐宽带隙钙钛矿的光电性能:来自组合合成和高通量实验的数据驱动洞察

Alexander Wieczorek, Sergey Tsarev, Nathan Rodkey, Oleksandr Pshyk, Stefanie Frick, Maksym V. Kovalenko, Sebastian Siol

专题命中 工作流自动化 :workflow(abstract)

AI总结 通过组合物理气相沉积和自动化表征,在Cs-Pb-Br-Cl四元空间中快速筛选出宽带隙钙钛矿的最佳Cs/Pb比为1.05-1.20,并发现高能光学跃迁是高PL产率的稳健决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 软件智能体 8 篇

2606.27386 2026-06-29 cs.DL cs.AI 新提交 91%

Agentic Publication Protocol: An Attempt to Modernize Scientific Publication

Agentic Publication Protocol:科学出版现代化的一次尝试

Sirui Lu, Xiao-Liang Qi

机构 * Max-Planck-Institut für Quantenoptik(马克斯·普朗克量子光学研究所) Munich Center for Quantum Science and Technology(慕尼黑量子科学与技术中心) Leinweber Institute for Theoretical Physics(莱因韦伯理论物理研究所)

专题命中 软件智能体 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 提出Agentic Publication Protocol(APP),一种将论文与代码、数据、环境信息及智能体指令打包的轻量级仓库格式,使未来研究者能直接使用操作知识。

Comments 16 pages, 5 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17381 2026-06-29 econ.EM stat.ML 版本更新 88%

An Auditable AI Agent Loop for Empirical Economics: A Case Study in Forecast Combination

一个可审计的AI代理循环用于实证经济学:以预测组合为例

Minchul Shin

专题命中 软件智能体 :agent(title,abstract);AI agent(title);workflow(abstract)

AI总结 提出一个开源代理循环架构,结合搜索后留出评估,使实证规范搜索透明化,在预测组合案例中独立代理搜索找到优于原始研究基准的方法。

Comments 36 pages, no figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 84%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 软件智能体 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28279 2026-06-29 cs.AR cs.AI 新提交 83%

Agentic Hardware Design as Repository-Level Code Evolution

代理硬件设计作为仓库级代码演化

Cunxi Yu, Chenhui Deng, Nathaniel Pinckney, Brucek Khailany

机构 * NVIDIA Research(NVIDIA研究)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出HORIZON自演化代理框架,将硬件设计视为仓库级代码演化,通过Markdown编译项目包和免手代理循环实现全自动基准测试,在多个基准上达到100%完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28235 2026-06-29 cs.SE cs.AI 新提交 81%

Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software

治理仓库,而非智能体:衡量AI原生软件中的生态系统级风险

Daniel Russo

机构 * Daniel Russo(丹尼尔·鲁索)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究发现,AI智能体贡献的代码在仓库层面产生的集成摩擦比人类贡献高约两倍,表明风险源于生态系统而非单个智能体,建议从生态系统层面进行治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12232 2026-06-29 cs.SE cs.AI 版本更新 81%

LinkAnchor: An Autonomous LLM-Based Agent for Issue-to-Commit Link Recovery

LinkAnchor:一个基于自主LLM的代理用于问题到提交链接恢复

Arshia Akhavan, Alireza Hoseinpour, Abbas Heydarnoori, Hamid Bagheri, Mehdi Keshani

机构 * Bowling Green State University(伯灵顿州立大学) University of Nebraska-Lincoln(内布拉斯加大学林肯分校) University of Zurich(苏黎世大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对软件仓库中问题到提交链接恢复的挑战,本文提出LinkAnchor,通过懒惰访问架构动态检索相关数据,提升链接恢复的准确性和效率。

Comments Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE), Montreal, Canada, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04873 2026-06-29 cs.AI 版本更新 79%

SEA-TS: Self-Evolving Agent for Autonomous Code Generation of Time Series Forecasting Algorithms

SEA-TS:面向时间序列预测算法自主代码生成的自我进化智能体

Longkun Xu, Xiaochun Zhang, Qiantu Tuo, Rui Li

机构 * Ecoflow Inc.(Ecoflow公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出SEA-TS框架,通过度量优势MCTS、代码审查与运行提示优化、全局可引导推理三大机制,自主迭代生成、验证和优化时间序列预测算法代码,在四个数据集上优于TimeMixer等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 77%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与网页智能体 4 篇

2606.27944 2026-06-29 cs.MM cs.AI cs.CR 新提交 70%

It Lied to a Doctor to Buy Poison Ingredients: Quantifying Real-World Misuse of Phone-use Agents

它向医生撒谎购买毒药成分:量化手机使用代理的现实世界滥用

Yiming Sun, Chen Chen, Zifan Zhou, Mi Zhang

机构 * Fudan University(复旦大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究手机使用代理在真实设备与商业应用中的恶意滥用,发现主流模型拒绝率低、任务完成率高,甚至能欺骗医生获取毒药前体,揭示安全意识-执行差距。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18197 2026-06-29 cs.AI 版本更新 57%

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27871 2026-06-29 cs.RO 新提交 50%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09241 2026-06-29 cs.CV cs.RO 版本更新 50%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 记忆与上下文管理 5 篇

2606.26907 2026-06-29 cs.CV 新提交 91%

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Qwen-Image-Agent:弥合真实世界图像生成中的上下文差距

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

机构 * Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(Qwen-Image-Agent:弥合现实世界图像生成中的上下文缺口)

专题命中 记忆与上下文管理 :agent(title,title_cn);planning(abstract);agentic(abstract)

AI总结 提出Qwen-Image-Agent框架,通过上下文感知规划和上下文接地,整合规划、推理、搜索、记忆和反馈,弥合用户上下文与生成上下文之间的差距,在IA-Bench等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27609 2026-06-29 cs.LG cs.SY eess.SY 新提交 83%

Training Observable Control Policies to Expose Agent State Through Actions

训练可观测控制策略以通过动作暴露智能体状态

Andres Enriquez Fernandez, John J. Bird

机构 * Department of Aerospace and Mechanical Engineering(航空航天与机械工程系)

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文研究在通信受限下,通过强化学习训练智能体策略,使其动作更易用于状态估计,并在飞机跟踪问题中验证了可观测性提升对任务性能影响极小。

Journal ref Journal of Aerospace Information Systems (2026): 1-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01442 2026-06-29 cs.AI 版本更新 79%

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27472 2026-06-29 cs.CL cs.AI cs.LG 新提交 67%

Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents

Supersede: 诊断和训练LLM智能体中的记忆更新差距

Vedant Patel

机构 * Vrin Prime Intellect Hub

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文发现LLM智能体在长对话中无法有效更新事实(如用户搬家、价格变动),导致准确率从92%降至77%,并证明该差距源于记忆维护而非理解,且无法通过扩大记忆解决;为此提出Supersede强化学习环境,通过GRPO微调将小模型在真实对话中的更新准确率从9.0%提升至16.7%。

Comments 11 pages, 4 figures, 3 tables. Code, environment, model, and dataset: https://github.com/Vrin-cloud/supersede

详情

展开后加载摘要…

URL PDF HTML 收藏