arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-26 至 2026-05-26 共收录 27 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 27 篇

2605.25338 2026-05-26 cs.LG cs.AI 88%

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

CausalFlow: LLM Agent 失败的因果归因与反事实修复

Akash Bonagiri, Devang Borkar, Gerard Janno Anderias, Setareh Rafatirad, Houman Homayoun

机构 * Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 工具调用 :agent(title,title_cn);tool use(abstract);分类 cs.AI、cs.LG

AI总结 提出CausalFlow框架,通过反事实干预计算步骤级因果责任分数,识别失败步骤并生成最小编辑修复,用于测试时修复和训练时监督,在多个基准上优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25141 2026-05-26 cs.CL cs.AI 88%

LLM Agent Based Renewable Energy Forecasting Using Edge and IoT Data A Review of Solar Wind Weather and Grid Aware Decision Support

基于LLM Agent的利用边缘和物联网数据的可再生能源预测:太阳能、风能、天气和电网感知决策支持综述

Pavan Manjunath, Thomas Pruefer

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(title,title_cn);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了如何利用大语言模型代理整合异构传感器流、天气API数据、历史发电记录和电网约束,形成统一的决策支持工作流,以增强可再生能源预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 87%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);multi-agent(abstract)

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24220 2026-05-26 cs.DC 87%

Polar: Agentic RL on Any Harness at Scale

Polar: 任意框架下的大规模智能体强化学习

Binfeng Xu, Hao Zhang, Shaokun Zhang, Songyang Han, Mingjie Liu, Jian Hu, Shizhe Diao, Zhenghui Jin, Yunheng Zou, Michael Demoret, Jan Kautz, Yi Dong

专题命中 工具调用 :agentic(title);agent(abstract,abstract_cn);tool use(abstract);multi-agent(abstract)

AI总结 提出Polar框架,通过异步回滚和黑盒代理框架实现任意智能体框架上的可扩展强化学习,在软件工程任务中显著提升模型性能。

Comments 17 pages, 6 figures. 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25920 2026-05-26 cs.CL cs.AI 84%

Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning

LLM 能时间旅行吗?通过强化学习增强法律智能搜索中的时间一致性

Wei Fan, Yining Zhou, Mufan Zhang, Yanbing Weng, Yiran HU, Tianshi Zheng, Baixuan Xu, Chunyang Li, Jianhui Yang, Haoran Li, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) School of Law, Tsinghua University, Beijing, China(清华大学法学院) Cheriton School of Computer Science, University of Waterloo, Waterloo, Canada(滑铁卢大学丘成桐计算机科学系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出 LegalSearch-R1 框架,结合本地 statute RAG 和在线搜索,通过强化学习在跨修订期数据上训练,以解决法律 LLM 的时间偏差和搜索代理缺乏时间约束的问题,在13项法律任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03790 2026-05-26 cs.CL cs.AI 84%

NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning

NeoAMT: 基于强化学习的新词感知智能机器翻译

Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) NTT Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室,NTT公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出NeoAMT框架,利用基于Wiktionary的搜索工具和强化学习训练翻译智能体,以提升包含新词的源句翻译质量。

Comments ACL 2026 Main. Fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25310 2026-05-26 cs.CL 83%

Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams

工具调用依赖结构在LLM智能体残差流中是线性可解码的

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) Heslington, York(约克大学赫斯林顿校区)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.CL

AI总结 本研究通过低容量边探针在Qwen3-32B残差流中解码工具调用依赖图,发现该表示追踪抽象拓扑而非标识符值,且在不同模型和任务中可复制。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03675 2026-05-26 cs.AI cs.CL cs.IR 81%

OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search

OASES:面向智能搜索的结果对齐搜索-评估协同训练

Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) University of Southern California(南加州大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 提出OASES框架,通过结果对齐的过程奖励和搜索-评估协同训练,解决智能搜索中奖励稀疏和过程监督不可靠的问题,在多跳问答基准上优于强强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26037 2026-05-26 cs.CL 79%

Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

先升后降与知识图谱工具使用的四个接口通道

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.CL

AI总结 本文通过最小化知识图谱工具API实验,发现标准RLVR工具使用配方在自验证检索奖励下出现先升后降的崩溃模式,并识别出四种接口失败模式,提出接口反馈差异是核心原因,单次自蒸馏可缓解但受接口限制。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25720 2026-05-26 cs.AI 79%

Learning to Search and Searching to Learn for Generalization in Planning

学习搜索与搜索学习以实现规划中的泛化

Michael Aichmüller, Yannik Hesse, Hector Geffner

机构 * Department of Machine Learning and Reasoning, RWTH Aachen University(机器学习与推理部门,亚琛RWTH大学)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI

AI总结 提出一种结合关系图神经网络值启发式的自改进WA*学习框架,通过搜索引导和Q学习更新启发式,实现零样本泛化,在多个规划任务中优于深度强化学习。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11557 2026-05-26 cs.AI 79%

UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

UniToolCall: 统一LLM智能体的工具使用表示、数据与评估

Yijuan Liang, Xinghao Chen, Yifan Ge, Ziyi Wu, Hao Wu, Changyu Zeng, Wei Xing, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI

AI总结 提出UniToolCall框架,通过标准化工具集构建、数据集生成和评估流程,结合22k+工具和390k+训练实例,引入锚点链接机制,在混合设置下使Qwen3-8B单轮严格精度达93.0%,超越GPT、Gemini和Claude。

Comments 21 pages, 10 figures, 9 tables. Code and datasets are publicly available at: https://github.com/EIT-NLP/UniToolCall

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28716 2026-05-26 cs.AI 79%

Dynamic Dual-Granularity Skill Bank for Agentic RL

动态双粒度技能库用于智能体强化学习

Songjun Tu, Chengdong Xu, Qichao Zhang, Yaocheng Zhang, Xiangyuan Lan, Linjing Li, Dong Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Sun Yat-Sen University(中山大学) MemoraX AI

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 提出D2Skill,一种动态双粒度技能库,通过任务技能和步骤技能分别提供高层指导和细粒度决策支持,利用配对基线回放和技能注入回放的性能差距更新技能和优化策略,在ALFWorld等任务上显著提升性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24539 2026-05-26 cs.AI 79%

DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations

DemoEvolve:利用演示克服智能体框架演化中的稀疏反馈

Lirong Che, Yuzhe yang, Peiwen lin, Chuang wang, Xueqian wang, Jian su

机构 * Tsinghua University(清华大学) AgiBot

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI

AI总结 提出DemoEvolve方法,通过人类演示引导框架演化,解决长时域随机环境中自生成轨迹因稀疏反馈和高方差导致的脆弱性问题,在Liar's Dice和Balatro任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23951 2026-05-26 cs.AI cs.LO cs.MA 79%

Methods for Formal Verification of Agent Skills: Three Layers Toward a Mechanically Checkable Capability-Containment Proof

智能体技能形式化验证方法:面向可机械检查的能力包含证明的三层架构

Alfredo Metere

机构 * Metere Consulting, LLC(梅特尔咨询公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出三层可组合方法(静态抽象解释、精炼类型系统、SMT有界模型检测),将智能体技能从声明或测试级别提升至形式化验证级别,实现机械可检查的能力包含证明。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12538 2026-05-26 cs.CR cs.AI cs.SE 73%

MCPXKIT: The Unified Toolkit for Analyzing Model Context Protocol Security

MCPXKIT:分析模型上下文协议安全性的统一工具包

Yongjian Guo, Puzhuo Liu, Wanlun Ma, Zehang Deng, Xiaogang Zhu, Peng Di, Xi Xiao, Sheng Wen

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国) Swinburne University of Technology, Melbourne, Australia(斯威本科技大学,墨尔本,澳大利亚) The University of Adelaide, Adelaide, Australia(阿德莱德大学,阿德莱德,澳大利亚) UNSW Sydney, Australia(悉尼大学,澳大利亚)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MCPXKIT工具包,分类实现了31种攻击方法,通过定量实验揭示了MCP在工具描述依赖、文件攻击、链攻击及数据命令区分等方面的漏洞,并提供了安全增强建议。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC). $\href{https://ieeexplore.ieee.org/abstract/document/11531012}{Official \ version}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10593 2026-05-26 cs.SE cs.AI cs.CL cs.LG 70%

ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs

ToolRegistry: 一个用于函数调用LLM的协议无关工具管理库

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :function calling(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ToolRegistry系统,通过统一工具对象和注册表实现协议无关的工具管理,支持多种传输协议、可插拔后端和高级功能,显著减少集成代码并提升吞吐量。

Comments 16 pages, 4 figures, v3: add co-author, permission system, progressive tool disclosure, think-augmented calling, RPC framing, multi-provider support

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24426 2026-05-26 cs.CL 70%

SEAL: Synergistic Co-Evolution of Agents and Learning Environments

SEAL: 智能体与学习环境的协同共演化

Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu

机构 * Ant Group(蚂蚁集团) Westlake University(西湖大学) University of Michigan--Ann Arbor(密歇根大学安娜堡分校) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 提出SEAL框架,通过协同演化智能体策略与训练环境,解决智能体与环境错配问题,在低资源多轮工具使用任务中提升性能并实现正向分布外迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25832 2026-05-26 cs.RO cs.AI cs.CL cs.CV 62%

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

当搜索成为记忆:将机器人设计试验转化为可迁移技能

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

机构 * University of Michigan(密歇根大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Auto-Robotist,一种自进化LLM代理,通过将形态搜索轨迹提炼为自然语言技能库,实现可迁移的机器人设计知识,在EvoGym任务中提升冷启动搜索并跨设计空间迁移技能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25749 2026-05-26 cs.IR cs.AI cs.LG 62%

DeGRe: Dense-supervised Generative Reranking for Recommendation

DeGRe: 密集监督的生成式重排序用于推荐

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia

机构 * College of Software, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Beijing China State Key Lab of CAD\&CG, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Shanghai China College of Software, Zhejiang University Rajax Network Technology, Taobao Shangou of Alibaba State Key Lab of CAD\&CG, Zhejiang University

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出DeGRe框架,通过离线探索中的密集监督信号(Lookahead Evaluator)指导在线生成器(Online Generator)进行单步贪婪解码,解决重排序中的启发式标签偏差和信用分配问题。

Comments Accepted to KDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25988 2026-05-26 cs.CL 57%

What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA

什么使医学检查器可训练?诊断生物医学问答中检查器引导的RAG中的信号崩溃和奖励黑客

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wan

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 本文通过比较四种NLI检查器作为GRPO训练的医学RAG代理的过程奖励,诊断了信号崩溃和奖励黑客现象,发现检查器的输出分布而非保留准确率决定了其是否提供可训练梯度,并提出了验证器作为奖励系统的边界条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19113 2026-05-26 cs.AI 57%

Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning

混合深度搜索器:可扩展的并行与顺序搜索推理

Dayoon Ko, Jihyuk Kim, Haeju Park, Sohyeon Kim, Dahyun Lee, Yongrae Jo, Gunhee Kim, Moontae Lee, Kyungjae Lee

机构 * Seoul National University(首尔国立大学) LG AI Research(LG AI研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Seoul(首尔大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出混合搜索策略HybridDeepSearcher,通过并行查询扩展与显式证据聚合结合顺序推理,在多个基准上显著提升性能并实现测试时搜索扩展。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23944 2026-05-26 cs.AI math.PR 57%

Right-Sizing Communication and Recommendation Set Size in AI-Assisted Search

AI辅助搜索中的通信与推荐集规模合理设定

Jing Dong, Prakirt Raj Jhunjhunwala, Yash Kanoria

机构 * Columbia Business School, Columbia University(哥伦比亚大学商学院) Amazon.com Inc.(亚马逊公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 通过建模用户与AI推荐系统的交互,研究在考虑通信成本和搜索成本时,如何优化消息精度和推荐集大小以最大化用户期望收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07257 2026-05-26 cs.LG 57%

Test-Time Graph Search for Goal-Conditioned Reinforcement Learning

测试时图搜索用于目标条件强化学习

Evgenii Opryshko, Junwei Quan, Claas Voelcker, Yilun Du, Igor Gilitschenski

机构 * Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系) Vector Institute, Toronto, Canada(向量研究所) University of Texas at Austin, Austin, USA(德克萨斯大学奥斯汀分校) Harvard University, Cambridge, USA(哈佛大学)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出测试时图搜索方法,通过构建离线数据集图并自适应选择子目标,在不额外训练的情况下显著提升目标条件强化学习在长时域任务中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11183 2026-05-26 econ.TH 50%

Competition, Persuasion, and Search

竞争、说服与搜索

Teddy Mekonnen, Bobak Pakzad-Hurson

专题命中 工具调用 :agent(abstract)

AI总结 研究信息市场竞争如何影响剩余创造与分配,通过构建代理人序贯搜索高质量商品并重复购买信息经纪人信号的模型,发现低搜索成本时市场结构不影响剩余,高搜索成本时竞争有利于代理人但降低总剩余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25081 2026-05-26 physics.chem-ph cond-mat.dis-nn cond-mat.soft physics.comp-ph 50%

Separable Force Matching of PBE0 Hybrid-Functional Reference Forces for Path-Integral Simulations of Liquid Water

用于液态水路径积分模拟的PBE0杂化泛函参考力的可分离力匹配

Jan Kessler, Thomas Spura, Kristof Karhan, Thomas D. Kühne

专题命中 工具调用 :workflow(abstract)

AI总结 提出一种可分离非线性最小二乘力匹配方法,基于PBE0杂化泛函参考力拟合柔性四点位水模型,提高了准确性和可重复性,并成功应用于液态水的路径积分模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19629 2026-05-26 math.OC 50%

A Multiobjective Optimization Framework for Irrigation Water Allocation

灌溉水资源分配的多目标优化框架

Nahid Sultana, M. M. Rizvi, G. M. Wali Ullah, Micah Nehring

专题命中 工具调用 :planning(abstract)

AI总结 本研究通过扩展可行决策空间并系统刻画经济-环境权衡谱,提出一个多目标优化框架,生成高分辨率帕累托前沿,以平衡灌溉规划中的经济效益与环境流量需求。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24125 2026-05-26 cs.RO 50%

Anisotropic Diffusion-Driven Ergodic Coverage in Multi-Robot Systems

多机器人系统中各向异性扩散驱动的遍历覆盖

Thales C. Silva, Anoop Kiran, Nora Ayanian

机构 * Department of Computer Science(计算机科学系) Brown University(布朗大学)

专题命中 工具调用 :agent(abstract)

AI总结 提出一种基于Perona-Malik各向异性扩散的遍历搜索方法,通过非均匀误差传播生成势场,引导多机器人系统实现更灵活的遍历覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏