arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 92539 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2605.15041 2026-05-15 cs.AI cs.CL 84%

Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

基于案例的自适应推理与执行校准:大型语言模型工具使用

Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CAST框架,通过历史执行轨迹作为结构化案例,提取复杂性和失败特征以优化推理策略,提升工具使用准确性并减少冗余推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09734 2026-05-12 cs.SE cs.AI cs.MA 84%

Trajectory Supervision for Continual Tool-Use Learning in LLMs

在大语言模型中为持续工具使用学习提供轨迹监督

Vishnu Vardhan Reddy, Sagnik Chatterjee, Soumik Bhatta

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 研究通过对比保留工具使用轨迹与去除中间API轨迹的方法,发现保留轨迹能提升API调用准确率,但需更多训练token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07042 2026-05-11 cs.AI cs.LG 84%

The Context Gathering Decision Process: A POMDP Framework for Agentic Search

上下文收集决策过程:一种用于代理搜索的POMDP框架

Chinmaya Kausik, Adith Swaminathan, Nathan Kallus

机构 * University of Michigan(密歇根大学) Netflix

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CGDP框架,通过将LLM行为建模为近似汤普森采样,引入谓词方法分解搜索过程,并设计两种干预措施提升多跳推理能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01264 2026-05-05 cs.SE cs.LG 84%

FeedbackLLM: Metadata driven Multi-Agentic Language Agnostic Test Case Generator with Evolving prompt and Coverage Feedback

FeedbackLLM: 基于元数据的多智能体语言无关测试用例生成器与演进提示和覆盖反馈

Kushal Jasti, Tejamani Prashanth Sahu, Rishitha Pentyala, Muvvala Mohit, Vivek Yelleti

机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)

专题命中 工具调用 :agentic(title);agent(abstract,abstract_cn);分类 cs.LG、cs.SE

AI总结 FeedbackLLM通过双阶段方法生成测试用例,利用元数据反馈提升覆盖率,有效解决传统方法的计算开销和可扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 84%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17555 2026-04-23 cs.AI cs.CL cs.IR 84%

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

CoSearch:通过强化学习联合训练推理和文档排序以实现代理搜索

Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

机构 * Center for Intelligent Information Retrieval, University of Massachusetts Amherst(智能信息检索中心,马萨诸塞大学阿默斯特分校) Snap Inc(Snap公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CoSearch框架,通过群体相对策略优化联合训练推理代理和生成文档排序模型,以解决代理搜索中检索系统性能瓶颈问题,实验表明其在多个问答基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 84%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 工具调用 :agent(title);planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13417 2026-04-16 cs.SE cs.AI cs.MA 84%

Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol

Vasundra Srinivasan

机构 * Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程(O’Reilly))

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08791 2026-04-16 cs.CL cs.AI 84%

Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments

通过自动化构建环境提升大语言模型的反馈驱动工具使用

Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06185 2026-04-09 cs.HC cs.AI cs.CL 84%

Benchmarking LLM Tool-Use in the Wild

在真实环境中评估大语言模型工具使用能力

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

机构 * Tencent(腾讯)

专题命中 工具调用 :tool-use(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出WildToolBench基准测试,通过评估57个LLM在真实用户行为下的表现,揭示LLM在工具使用中的鲁棒性不足,强调需重新考虑LLM、用户与工具之间的交互。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04949 2026-04-08 cs.IR cs.AI cs.CL 84%

Learning to Retrieve from Agent Trajectories

从智能体轨迹中学习检索

Yuqi Zhou, Sunhao Dai, Changle Qu, Liang Pang, Jun Xu, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) CAS Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出从智能体交互数据直接训练检索模型的新方法,通过分析轨迹中的行为信号,提出LRAT框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI 84%

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00084 2026-03-04 cs.DL cs.AI cs.CL cs.IR 84%

DeepXiv-SDK: An Agentic Data Interface for Scientific Literature

DeepXiv-SDK: 一种用于科学文献的代理数据接口

Hongjin Qian, Ziyi Xia, Ze Liu, Jianlyu Chen, Kun Luo, Minghao Qin, Chaofan Li, Lei Xiong, Junwei Lan, Sen Wang, Zhengyang Liang, Yingxia Shao, Defu Lian, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 DeepXiv-SDK通过三层代理数据接口提升科学文献的数据访问效率,支持ArXiv语料库并提供开源工具和API。

Comments Project at https://github.com/DeepXiv/deepxiv_sdk

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04786 2026-03-03 cs.LG cs.AI 84%

AgentOCR: Reimagining Agent History via Optical Self-Compression

AgentOCR: 通过光学自压缩重新想象代理历史

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An

机构 * NTU(国立科技大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 AgentOCR通过光学自压缩技术,将代理历史转换为紧凑图像,从而在保持性能的同时显著减少token消耗和内存使用。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16958 2026-02-20 cs.AI cs.LG 84%

Automating Agent Hijacking via Structural Template Injection

通过结构模板注入自动化代理劫持

Xinhao Deng, Jiaqing Wu, Miao Chen, Yue Xiao, Ke Xu, Qi Li

机构 * Tsinghua University \& Ant Group Hangzhou China Tsinghua University Beijing China Zhongguancuan Laboratory Beijing China Tsinghua University \& Ant Group Tsinghua University Zhongguancuan Laboratory

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Phantom框架,通过结构模板注入自动化代理劫持,提升攻击成功率和效率,揭示结构模板劫持的严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04726 2026-02-05 cs.SE cs.AI 84%

Supporting software engineering tasks with agentic AI: Demonstration on document retrieval and test scenario generation

用代理AI支持软件工程任务:文档检索与测试场景生成的演示

Marian Kica, Lukas Radosky, David Slivka, Karin Kubinova, Daniel Dovhun, Tomas Uhercik, Erik Bircak, Ivan Polasek

机构 * Gratex International(格拉特克斯国际) Department of Applied Informatics Faculty of Mathematics, Physics and Informatics Comenius University(应用信息学院数学、物理和信息学院康门ius大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出利用代理AI解决软件工程中的文档检索和测试场景生成问题,通过专用代理处理不同任务,提升软件开发效率。

Comments This is a preprint of a paper that was accepted at the International Conference on Artificial Intelligence, Computer, Data Sciences and Applications (ACDSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15074 2026-01-22 cs.SE cs.LG 84%

SmartOracle -- An Agentic Approach to Mitigate Noise in Differential Oracles

SmartOracle -- 一种缓解差分预言机噪声的代理方法

Srinath Srinivasan, Tim Menzies, Marcelo D'Amorim

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.LG、cs.SE

AI总结 SmartOracle通过代理系统减少差分预言机噪声,提高模糊测试准确性并降低分析成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03571 2025-12-04 cs.AI cs.LG cs.PL 84%

EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths

EnCompass:通过程序执行路径搜索增强智能体编程

Zhening Li, Armando Solar-Lezama, Yisong Yue, Stephan Zheng

机构 * Asari AI MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Caltech CMS(加州理工学院 CMS)

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 EnCompass通过解耦智能体工作流逻辑与推理策略,提供一种基于Python的框架,允许快速提升智能体可靠性并灵活切换推理策略。

Comments 65 pages, 2 figures, published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26575 2025-10-31 cs.CL cs.AI 84%

InfoFlow: Reinforcing Search Agent Via Reward Density Optimization

Kun Luo, Hongjin Qian, Zheng Liu, Ziyi Xia, Shitao Xiao, Siqi Bao, Jun Zhao, Kang Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17365 2025-10-16 cs.LG cs.AI 84%

DynaSearcher: Dynamic Knowledge Graph Augmented Search Agent via Multi-Reward Reinforcement Learning

Chuzhan Hao, Wenfeng Feng, Yuewei Zhang, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04612 2025-09-16 cs.RO cs.AI cs.LG 84%

Tool-as-Interface: Learning Robot Policies from Observing Human Tool Use

Haonan Chen, Cheng Zhu, Shuijing Liu, Yunzhu Li, Katherine Driggs-Campbell

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

Comments Accepted to CoRL 2025. Project page: https://tool-as-interface.github.io. 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06980 2025-09-10 cs.LG cs.AI 84%

RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use

Jiajun Chai, Guojun Yin, Zekun Xu, Chuhuai Yue, Yi Jia, Siyu Xia, Xiaohan Wang, Jiwen Jiang, Xiaoguang Li, Chengqi Dong, Hang He, Wei Lin

机构 * RLFactory Team(RLFactory团队)

专题命中 工具调用 :tool-use(title);tool use(abstract);workflow(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04752 2025-09-08 cs.HC cs.AI cs.LG 84%

SePA: A Search-enhanced Predictive Agent for Personalized Health Coaching

Melik Ozolcer, Sang Won Bae

专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

Comments Accepted at IEEE-EMBS International Conference on Biomedical and Health Informatics (BHI'25). 7 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15495 2025-08-27 cs.CL cs.AI 84%

TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use

Junjie Ye, Yilong Wu, Sixian Li, Yuming Yang, Zhiheng Xi, Tao Gui, Qi Zhang, Xuanjing Huang, Peng Wang, Zhongchao Shi, Jianping Fan, Zhengyin Du

机构 * Fudan University(复旦大学) Lenovo Research(联想研究) ByteDance Seed(字节跳动种子) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12961 2025-08-22 cs.CL cs.AI 84%

Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger

Wenjun Li, Dexun Li, Kuicai Dong, Cong Zhang, Hao Zhang, Weiwen Liu, Yasheng Wang, Ruiming Tang, Yong Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL

Comments 25 pages, camera ready version for ACL-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13774 2025-08-20 cs.SE cs.AI 84%

Agentic DraCor and the Art of Docstring Engineering: Evaluating MCP-empowered LLM Usage of the DraCor API

Peer Trilcke, Ingo Börner, Henny Sluyter-Gäthje, Daniil Skorinkin, Frank Fischer, Carsten Milling

机构 * University of Potsdam, Germany(波恩大学)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

Comments Preprint, submitted to the 2nd Workshop on Computational Drama Analysis at DraCor Summit 2025, September 03, 2025, Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08137 2025-08-12 cs.LG cs.AI cs.SY eess.SY 84%

MuaLLM: A Multimodal Large Language Model Agent for Circuit Design Assistance with Hybrid Contextual Retrieval-Augmented Generation

Pravallika Abbineni, Saoud Aldowaish, Colin Liechty, Soroosh Noorzad, Ali Ghazizadeh, Morteza Fayazi

机构 * University of Utah(犹他大学) University of Michigan(密歇根大学)

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18959 2025-07-04 cs.IR cs.CL cs.LG 84%

From Web Search towards Agentic Deep Research: Incentivizing Search with Reasoning Agents

Weizhi Zhang, Yangning Li, Yuanchen Bei, Junyu Luo, Guancheng Wan, Liangwei Yang, Chenxuan Xie, Yuyao Yang, Wei-Chieh Huang, Chunyu Miao, Henry Peng Zou, Xiao Luo, Yusheng Zhao, Yankai Chen, Chunkit Chan, Peilin Zhou, Xinyang Zhang, Chenwei Zhang, Jingbo Shang, Ming Zhang, Yangqiu Song, Irwin King, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Amazon(亚马逊) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22853 2025-07-03 cs.CL cs.AI 84%

DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues

Kyochul Jang, Donghyeon Lee, Kyusik Kim, Dongseok Heo, Taewhoo Lee, Woojeong Kim, Bongwon Suh

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Department of Intelligence and Information, Seoul National University(首尔国立大学智能与信息系) Korea University(韩国大学) AIGEN Sciences(AIGEN科学) Cornell University(康奈尔大学)

专题命中 工具调用 :tool-use(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments 9 pages, ACL 2025 Vienna

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13547 2025-06-27 cs.SE cs.AI 84%

ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs

Shirley Kokane, Ming Zhu, Tulika Awalgaonkar, Jianguo Zhang, Thai Hoang, Akshara Prabhakar, Zuxin Liu, Tian Lan, Liangwei Yang, Juntao Tan, Rithesh Murthy, Weiran Yao, Zhiwei Liu, Juan Carlos Niebles, Huan Wang, Shelby Heinecke, Caiming Xiong, Silivo Savarese

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏