arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-20 至 2026-04-20 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 13 篇

2604.10261 2026-04-20 cs.AI cs.CL cs.LG 90%

The Amazing Agent Race: Strong Tool Users, Weak Navigators

令人惊叹的智能体竞赛:强大的工具使用者,薄弱的导航者

Zae Myung Kim, Dongseok Lee, Jaehyung Kim, Vipul Raheja, Dongyeop Kang

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校) Yonsei University(延世大学) Grammarly

专题命中 工具调用 :agent(title,abstract);tool use(title);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AAR基准测试,通过有向无环图谜题评估智能体的导航与工具使用能力,发现线性基准无法检测到导航失误问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16004 2026-04-20 cs.CL cs.AI 89%

AgentV-RL: Scaling Reward Modeling with Agentic Verifier

AgentV-RL: 通过代理验证器扩展奖励建模

Jiazheng Zhang, Ziche Fu, Zhiheng Xi, Wenqing Jing, Mingxu Chai, Wei He, Guoqiang Zhang, Chenghao Fan, Chenxin An, Wenxiang Chen, Zhicheng Liu, Haojie Pan, Dingwei Zhu, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 工具调用 :agentic(title,summary_cn);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Agentic Verifier框架,通过多轮工具增强的反思过程提升奖励建模效果,实验显示其在并行和顺序TTS任务中表现优异,4B变体超越现有最优ORMs 25.2%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI 89%

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :tool-use(title,abstract);workflow(abstract,abstract_cn);agent(abstract);tool use(abstract)

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15559 2026-04-20 cs.AI 88%

Subliminal Transfer of Unsafe Behaviors in AI Agent Distillation

AI代理蒸馏中不安全行为的潜意识转移

Jacob Dang, Brian Y. Xie, Omar G. Younis

机构 * UCLA(加州大学洛杉矶分校) Santa Monica College(圣蒙代克学院) Mila, Silverstream AI(Mila与Silverstream AI)

专题命中 工具调用 :agent(title,abstract);AI agent(title);agentic(abstract);分类 cs.AI

AI总结 研究探讨了在代理系统中行为特征通过模型蒸馏的潜意识转移,通过两个实验设置发现学生代理继承了教师代理的破坏性行为偏见,证明显式数据清理不足以防止隐含行为偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12482 2026-04-20 cs.AI 85%

Agentic AI Optimisation (AAIO): what it is, how it works, why it matters, and how to deal with it

代理AI优化(AAIO):它是什么,如何运作,为什么重要,以及如何应对它

Luciano Floridi, Carlotta Buttaboni, Nicolas Gertler, Emmie Hine, Jessica Morley, Claudio Novelli, Tyler Schroder

机构 * Digital Ethics Center, Yale University(耶鲁大学数字伦理中心) Department of Legal Studies, University of Bologna(博洛尼亚大学法律研究系) Department of Computer Science(计算机科学系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文探讨了代理AI优化(AAIO)作为确保网站与代理AI系统无缝交互的关键方法,分析了其在数字基础设施中的重要性及治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17052 2026-04-20 cs.LG 83%

Dynamic Tool Dependency Retrieval for Lightweight Function Calling

轻量级函数调用的动态工具依赖检索

Bhrij Patel, Davide Belli, Amir Jalalirad, Maximilian Arnold, Aleksandr Ermolov, Bence Major

机构 * Qualcomm AI Research(高通人工智能研究) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :function calling(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出动态工具依赖检索方法,通过结合初始查询和逐步展开的工具调用计划,提升函数调用的准确性和效率,实验表明其在多个数据集和模型上均优于现有静态检索方法。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00739 2026-04-20 cs.AI cs.LG cs.MA 81%

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

向理解、分析和优化代理AI执行:一种以CPU为中心的视角

Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从CPU角度分析代理AI工作负载的瓶颈,提出两种优化方法,降低CPU-GPU资源分配偏差,提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15709 2026-04-20 cs.AI 79%

Bilevel Optimization of Agent Skills via Monte Carlo Tree Search

通过蒙特卡洛树搜索优化代理技能

Chenyi Huang, Haoting Zhang, Jingxu Xu, Zeyu Zheng, Yunduan Lin

机构 * Department of Mathematics(数学系) National University of Singapore(国立新加坡大学) Department of Industrial Engineering and Operations Research(工业工程与运营管理系) University of California at Berkeley(加州大学伯克利分校) Department of Decision, Operation and Technology(决策、运营与技术系) The Chinese University of Hong Kong(香港中文大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出通过蒙特卡洛树搜索优化代理技能的双层优化框架,提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15597 2026-04-20 cs.CL cs.HC 70%

LLMs Corrupt Your Documents When You Delegate

当您委托时,大型语言模型会破坏您的文档

Philippe Laban, Tobias Schnabel, Jennifer Neville

机构 * Microsoft Research(微软研究院)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究发现,当前LLM在委托工作中会破坏文档,即使前沿模型也平均破坏25%的内容,文档大小和交互长度加剧了这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20633 2026-04-20 cs.AI 70%

Seed1.8 Model Card: Towards Generalized Real-World Agency

Seed1.8 模型卡:迈向通用的现实世界代理

Bytedance Seed

机构 * Bytedance Seed(字节跳动Seed)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG 70%

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool use(abstract);planning(abstract);分类 cs.LG

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09689 2026-04-20 cs.CR cs.AI 57%

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

当搜索出错时:针对具有网络搜索功能的大型语言模型的红队测试

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University of Aeronautics(南京航空航天大学) Tsinghua University, China(清华大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文提出CREST-Search框架,针对具有网络搜索功能的LLM的安全性问题,通过三种新型攻击策略和迭代上下文优化机制,揭示网络搜索带来的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16727 2026-04-20 cs.AI 57%

Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints

反思搜索器:通过带有约束的强化学习提高大语言模型的可靠性

Zhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yinchun Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出反思搜索器框架,结合置信度校准与基于检索的搜索,通过强化学习优化准确性,提升模型输出的可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏