arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 35504 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 35504 篇

2606.02355 2026-06-02 cs.AI cs.LG 81%

SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training

SIRI:具有内在技能的自我内化强化学习用于LLM智能体训练

Zhongyu He, Yuanfan Li, Fei Huang, Tianyu Chen, Siyuan Chen, Xingyang Li, Meng Hsuan Yu, Xiangrong Liu, Leyi Wei, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Xiamen University(厦门大学) Meituan(美团) Macao Polytechnic University(澳门 polytechnic 大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SIRI框架,通过自我技能挖掘、验证和内化,使LLM智能体无需外部技能生成器或推理时技能库即可提升长程任务性能,在ALFWorld和WebShop上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 81%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26684 2026-06-02 cs.LG cs.AI 81%

Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

超越轨迹级归因:基于图的智能体强化学习信用分配

Xin Cheng, Shuo He, Lang Feng, HaiYang Xu, Ming Yan, Lei Feng, Bo An

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GraphGPO方法,通过构建状态转移图并利用全局信息估计各状态到任务目标的距离,实现步骤级信用分配,提升训练效率和性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31404 2026-06-01 cs.CL cs.AI 81%

The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning

剑、盾与阿喀琉斯之踵:大型语言模型在导航规划中空间推理的语言归纳偏置特征化

Xudong Zhang, Jian Yang, Shengkai Wang, Jiangpeng Tian, Shaowen Chen, Xian Wei, Ke Li, Xiong You

机构 * East China Normal University(东华大学) Information Engineering University(信息工程大学) Zhengzhou University(郑州大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 提出双干预框架,通过表示干预和上下文干预分离语言结构与上下文线索,揭示LLM在导航规划中语言归纳偏置的规律:拓扑信息是稳健规划的支柱,语言格式是双刃剑,语义信息是致命弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20873 2026-06-01 cs.AI cs.LG 81%

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench: 生成可扩展且可验证的规划数据以评估和训练大型语言模型

Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学校) LLM Department, Hunyuan Team, Tencent(腾讯 Hunyuan 团队 LLM 部门) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出PlanningBench框架,通过约束驱动合成管道生成可扩展、多样化且可验证的规划数据,用于评估和训练LLMs,并验证其在提升规划能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30274 2026-05-29 cs.CL cs.AI 81%

Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection

Loong: 一种类人长文档翻译代理,具有观察与行动的适应性上下文选择

Yutong Wang, Xuebo Liu, Derek F. Wong, Zhilin Li, Rongqing Jiang, Min Zhang, Shimin Tao, Daimeng Wei, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院自然语言处理与CT实验室) Huawei Translation Services Center(华为翻译服务中心)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出Loong代理,通过3E记忆模块和强化学习优化上下文策略,解决长文档翻译中上下文窗口限制和冗余信息问题,在英⇄中、德、法翻译中平均提升13.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27721 2026-05-28 cs.CL cs.AI 81%

UserHarness: Harnessing User Minds for Stronger Agent Theory-of-Mind

UserHarness:利用用户心智增强智能体心理理论

Cheng Qian, Jiayu Liu, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出UserHarness框架,通过显式重建用户心智状态(信念、意图等)进行心理理论推理,在五个基准上达到95.94%的宏准确率,相对提升超15%。

Comments 19 Pages, 4 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27697 2026-05-28 cs.RO cs.AI cs.LG 81%

Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning

仿真引导的扩散方法用于去中心化多机器人运动规划

Jinhao Liang, Sven Koenig, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于约束感知扩散模型的去中心化框架SID,通过仿真邻居未来轨迹并利用安全约束规划自身轨迹,在密集场景下实现高效协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10138 2026-05-28 cs.LG cs.AI 81%

Path Channels and Plan Extension Kernels: a Mechanistic Description of Planning in a Sokoban RNN

路径通道与计划扩展核:Sokoban RNN中规划的机制描述

Mohammad Taufeeque, Aaron David Tucker, Adam Gleave, Adrià Garriga-Alonso

机构 * FAR.AI Berkeley(FAR.AI伯克利)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过逆向工程分析无模型强化学习训练的卷积循环神经网络,发现其通过路径通道存储未来动作计划,并利用卷积核实现双向传播与回溯规划。

Comments Published as a conference paper at ICLR 2026. 34 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13853 2026-05-27 cs.CL cs.AI 81%

APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation

APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao

机构 * University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Wenge Technology Co., Ltd(Wenger科技有限公司)

专题命中 规划决策 :agentic(title);planning(abstract);分类 cs.AI、cs.CL

AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01833 2026-05-27 cs.AI cs.CL 81%

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

先规划后行动:面向LLM推理的高层规划引导强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

机构 * Case Western Reserve University, Cleveland, OH, USA(凯斯西储大学) Kean University, Union, NJ, USA(凯恩大学) The Ohio State University, Columbus, OH, USA(俄亥俄州立大学) Fudan University, Shanghai, China(复旦大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The University of Hong Kong, Hong Kong, China(香港大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 提出PTA-GRPO两阶段框架,通过高层规划引导与强化学习联合优化,提升LLM在数学和自然科学推理任务中的准确性和泛化能力。

Comments 19 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25346 2026-05-26 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 81%

Parallel Differentiable Reachability for Learning and Planning with Certified Neural Dynamics and Controllers

用于学习和规划的并行可微可达性:带认证的神经动力学与控制器

Keyi Shen, Glen Chou

机构 * MIT(麻省理工学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于JAX的并行可微可达性框架,结合泰勒模型流形构建与CROWN线性界传播,支持GPU批处理和自动微分,并用于认证训练和可达性感知的MPC,在非抓取操作和四旋翼任务中实现在线规划与有界不确定性下的认证可达集过近似。

Comments Robotics: Science and Systems XXII (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13282 2026-05-26 cs.AI cs.LG 81%

Differentiable Learning of Lifted Action Schemas for Classical Planning

经典规划中提升动作模式的可微学习

Jonas Reiter, Jakob Elias Gebler, Hector Geffner

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种神经网络架构,从完全可观测状态但动作参数未观测的轨迹中学习提升动作模式,实现近乎完美的结构恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 81%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21902 2026-05-22 cs.AI cs.CL 81%

Planning in the LLM Era: Building for Reliability and Efficiency

在大语言模型时代进行规划:构建可靠性与效率

Michael Katz, Harsha Kokel, Kavitha Srinivas, Shirin Sohrabi

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 本文探讨了在大语言模型时代规划领域的发展,重点介绍了通过生成可验证的符号求解器来提高规划的可靠性和效率的方法。

Comments Published at ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14259 2026-05-21 cs.AI cs.CL 81%

Hypergraph Enterprise Agentic Reasoner over Heterogeneous Business Systems

面向异构业务系统的超图企业代理推理器

Ling Wang, Xin Liu, Songnan Liu, Jianan Wang, Cheng Cheng, Yihan Zhu, Enyu Li, Yu Xiao, Jiangyong Xie, Duogong Yan, Jiangyi Chen

机构 * SUPCON

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出HEAR,一种基于分层超图本体的企业代理推理器,通过分层图层和超边层实现结构化多跳分析,无需重新训练LLM,在供应链任务中达到94.7%的准确率,并展示出适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21039 2026-05-21 cs.LG cs.AI 81%

Strict Subgoal Execution: Reliable Long-Horizon Planning in Hierarchical Reinforcement Learning

严格子目标执行:在分层强化学习中的可靠长 horizon 规划

Jaebak Hwang, Sanghyeon Lee, Jeongmo Kim, Seungyul Han

机构 * Graduate School of Artificial Intelligence(人工智能研究生院) Ulsan National Institute of Science and Technology (UNIST)(釜山国立科学与技术研究所) Ulsan, South Korea(韩国釜山)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出严格子目标执行(SSE)框架,通过前沿经验回放(FER)分离不可达与可接受的子目标,提高高层决策效率,从而在长horizon任务中实现更可靠的规划。

Comments 10 pages for main, 26 pages for total, Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20075 2026-05-20 cs.CL cs.AI 81%

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18565 2026-05-20 cs.CL cs.AI 81%

MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems

MINTEval: 评估长时间跨度智能体系统中的多目标干扰下的记忆

Hyunji Lee, Justin Chih-Yao Chen, Joykirat Singh, Zaid Khan, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出MINTEval基准,用于评估智能体在长时间跨度和多目标干扰下的记忆表现,通过长连接上下文、多领域和多类型问题来测试记忆增强代理的鲁棒性和泛化能力。

Comments Equal contribution; order decided by a coin flip. Code and data: https://github.com/amy-hyunji/MINTEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05933 2026-05-20 cs.CL cs.LG 81%

Structured Style-Rewrite with Chain-of-Thought Planning for Low-Resource Character Dialogue

结构化风格重写与思维链规划用于低资源字符对话

Chanhui Zhu

机构 * Guangdong University of Finance(广东金融学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种结构化风格重写框架,结合思维链规划,以解决低资源条件下中文字符驱动生成中的风格分离问题,通过分解角色风格为可解释的格式签名、语法和语用维度,并利用思维链监督进行显式风格规划,实验表明该方法在保持语义忠实性的同时提升了风格质量。

Comments 30 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19185 2026-05-20 cs.LG cs.AI 81%

Planner-Admissible Graph-PDE Value Extensions for Sparse Goal-Conditioned Planning

规划可接受的图-偏微分方程值扩展用于稀疏目标条件规划

Shiheng Zhang

机构 * Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在操作argmin-Q规划器下,哪些图值扩展是规划可接受的,提出了一种局部动作间隙证书,证明在 rollout 过程中若代理值误差低于真实动作间隙的一半,则贪心 rollout 可达到目标。通过比较原理填充距离界,AMLE 实现了该证书,而调和扩展由于反映边界击中概率而非最短路径贪心顺序,可能导致局部动作排名错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI 81%

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16142 2026-05-19 cs.AI cs.LG 81%

Property-Guided LLM Program Synthesis for Planning

基于属性的LLM程序合成用于规划

André G. Pereira, Augusto B. Corrêa, Jendrik Seipp

机构 * Federal University of Rio Grande do Sul(里约格朗德杜斯尔大学) University of Oxford(牛津大学) Linköping University(林奈大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了一种基于属性的LLM程序合成方法,通过检查候选程序是否满足形式定义的属性来指导LLM生成更高质量的程序,从而减少生成和评估成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09413 2026-05-19 cs.SD cs.AI cs.CL cs.MA eess.AS 81%

Speech-Hands: A Self-Reflection Voice Agentic Approach to Speech Recognition and Audio Reasoning with Omni Perception

Speech-Hands: 一种基于自我反思的语音代理方法用于语音识别和多感知音频推理

Zhen Wan, Chao-Han Huck Yang, Jinchuan Tian, Hanrong Ye, Ankita Pasad, Szu-wei Fu, Arushi Goel, Ryo Hachiuma, Shizhe Diao, Kunal Dhawan, Sreyan Ghosh, Yusuke Hirota, Zhehuai Chen, Rafael Valle, Chenhui Chu, Shinji Watanabe, Yu-Chiang Frank Wang, Boris Ginsburg

机构 * NVIDIA Kyoto University(京都大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出Speech-Hands框架,通过自我反思决策机制解决语音识别和外部声音理解任务中的信任问题,提升了模型在多任务音频推理中的准确性和鲁棒性。

Comments Accepted to ACL 2026. Oral Presentation. Code: https://github.com/YukinoWan/Speech-Hands OpenClaw Branch: https://github.com/openclaw/openclaw/pull/69073

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25723 2026-05-19 cs.CL cs.AI 81%

Natural-Language Agent Harnesses

自然语言代理Harness

Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出自然语言代理Harness(NLAH)作为一种可执行的自然语言对象,用于描述任务运行的Harness策略,并引入Intelligent Harness Runtime(IHR)作为共享运行时,能够将这些文档解释为代理调用、交接、状态更新、验证门和成果合同。实验表明,NLAH在编码、终端使用和计算机使用基准测试中表现与代码和提示实现相当,同时暴露了更短的静态Harness策略。

Comments revise paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24497 2026-05-19 cs.AI cs.LG cs.RO stat.ML 81%

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?

在联合嵌入预测世界模型中成功因素是什么?

Basile Terver, Tsung-Yen Yang, Jean Ponce, Adrien Bardes, Yann LeCun

机构 * Meta FAIR Inria Paris(巴黎理工院) Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) New York University(纽约大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。

Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10923 2026-05-19 cs.LG cs.CL 81%

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning

动态技能生命周期管理用于代理强化学习

Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng

机构 * Database Group, The Chinese University of Hong Kong(香港中文大学数据库组) Lanzhou University(兰州大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SLIM框架,通过动态优化变量管理代理强化学习中的外部技能集,提升任务性能。

Comments Implementation code is available at https://github.com/ejhshen/SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM 81%

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16508 2026-05-19 cs.CL cs.AI 81%

The Scaling Laws of Skills in LLM Agent Systems

大语言模型代理系统中技能的扩展规律

Charles Chen, Qiming Yu, Yuhang Gu, Zhuoye Huang, Hanjing Li, Hongyu Liu, Simin Liu, Jinhao Liu, Dengyun Peng, Jiangyi Wang, Zheng Yan, Fanqing Meng, Ethan Qin, Carl Che, Mengkang Hu

机构 * Evolvent AI Team(Evolvent AI团队)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究揭示了大规模代理系统中技能扩展的双重规律:路由准确性随库大小对数衰减,执行准确性通过联合路由乘法提升下游任务表现,二者通过路由衰减斜率参数耦合,优化后显著提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16268 2026-05-19 cs.HC cs.AI cs.LG 81%

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流

Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM的AI分流代理,通过多轮对话和提问提高客户问题分类准确性,提升银行客户服务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏