arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5039 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5039 篇

2608.01321 2026-08-04 cs.CL 新提交 74%

BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

BiCAA:面向搜索增强智能体的双向信用分配

Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07984 2026-07-10 cs.AI 新提交 74%

Agentic Neural Architecture Search

智能体神经架构搜索

Seokhoon Jeong, Mijung Kim, Taehwan Kim

机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06155 2026-07-08 cs.FL cs.CC cs.CL 新提交 74%

When Does Tool Use Increase the Expressive Power of Finite-Precision Recurrent Models?

工具使用何时会增强有限精度循环模型的表达能力?

Nikola Zubić, Qian Li, Yuyi Wang, Davide Scaramuzza

机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01465 2026-07-03 cs.AI 新提交 74%

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证

Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

机构 * Centific

专题命中 工具调用 :tool-use(title);分类 cs.AI

AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 74%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20113 2026-06-23 cs.CL cs.IR 新提交 74%

When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation

流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化

Elroy Galbraith

机构 * SMG Labs(SMG实验室)

专题命中 工具调用 :tool use(title);分类 cs.CL

AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10709 2026-06-10 cs.IR cs.AI 新提交 74%

Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training

通过训练期间回收零方差查询实现智能体搜索的有效强化学习

João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 74%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01839 2026-06-02 cs.DC cs.AR cs.LG 74%

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

观察而非预测:面向智能体服务的对话级解耦调度

Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

机构 * Anonymous Authors(匿名作者)

专题命中 工具调用 :agentic(title);分类 cs.LG

AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01314 2026-06-02 cs.AI 74%

SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems

SkillSmith: 技能与工具的协同进化用于自我改进的智能体系统

Yangbo Wei, Zhen Huang, Shaoqiang Lu, Junhong Qian, Qifan Wang, Chen Wu, Lei He

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所)

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 提出SkillSmith框架,通过统一提案空间和Lotka-Volterra生态效用模型实现技能与工具的协同进化,在多个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09287 2026-05-13 cs.AI 74%

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

PiCA:基于枢纽的搜索代理强化学习中的信用分配

Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05247 2026-05-08 cs.SE 74%

DADL: A Declarative Description Language for Enterprise Tool Libraries in LLM Agent Systems

DADL:用于LLM代理系统企业工具库的声明性描述语言

Axel Dunkel

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 DADL通过单一声明性文件描述REST API的端点、认证、分页等,实现企业工具库的集中管理和高效调用,显著降低上下文窗口消耗。

Comments 14 pages, 1 figure. Also published on Zenodo: https://doi.org/10.5281/zenodo.19931788

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 74%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 工具调用 :tool use(title);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23281 2026-04-22 cs.CL 74%

MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)

MCP与RAG与NLWeb与HTML:不同网页代理接口的有效性和效率比较(技术报告)

Aaron Steiner, Ralph Peeters, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文比较了四种网页代理接口的有效性和效率,发现RAG、MCP和NLWeb在效果和效率上均优于HTML。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates. ACM, New York, NY, USA, pp. 8493-8496

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12967 2026-04-15 cs.AI 74%

Cycle-Consistent Search: Question Reconstructability as a Proxy Reward for Search Agent Training

循环一致性搜索:问题可重构性作为搜索代理训练的代理奖励

Sohyun An, Shuibenyang Yuan, Hayeon Lee, Cho-Jui Hsieh, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 工具调用 :agent(title);分类 cs.AI

AI总结 本文提出Cycle-Consistent Search框架,通过问题可重构性作为奖励信号,无需黄金监督训练搜索代理,在信息检索任务中实现与监督基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09093 2026-04-13 cs.CR cs.CL 74%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 工具调用 :AI agent(title);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09375 2026-03-12 cs.LG 74%

Latent Poincaré Shaping for Agentic Reinforcement Learning

隐式庞加莱形变用于代理强化学习

Hanchen Xia, Baoyou Chen, Zelin Zang, Yutang Ge, Guojiang Zhao, Siyu Zhu

专题命中 工具调用 :agentic(title);分类 cs.LG

AI总结 LaPha通过在庞加莱潜在空间中引入隐式形变,提升LLM代理在数学任务中的性能,实现自我引导的测试时间扩展和更高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19526 2026-02-24 cs.CL 74%

How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1

如何训练你的深度研究代理?搜索-R1中的提示、奖励和策略优化

Yinuo Xu, Shuo Lu, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He, Jian Liang

机构 * CASIA(中国科学院自动化研究所) NLPR & MAIS(自然语言处理与人工智能研究室) School of AI UCAS(中国科学院大学人工智能学院) Meituan Inc(美团公司)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出通过优化提示模板、奖励函数和策略优化方法来提升深度研究代理的性能,通过实验发现快速思考模板和REINFORCE在性能和稳定性上表现更优,同时引入Search-R1++基线提升了Search-R1的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11551 2026-02-13 cs.CL 74%

SIGHT: Reinforcement Learning with Self-Evidence and Information-Gain Diverse Branching for Search Agent

SIGHT: 基于自证证据和信息增益多样分支的强化学习

Wenlin Zhong, Jinluan Yang, Yiquan Wu, Yi Liu, Jianhang Yao, Kun Kuang

机构 * Zhejiang University(浙江大学) Chongqing Ant Consumer Finance Co., Ltd.(重庆蚂蚁消费金融有限公司) Alibaba Group(阿里巴巴集团)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 SIGHT通过自证证据和信息增益驱动多样化分支,提升搜索代理的自主推理能力,减少冗余并增强探索策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16376 2026-02-12 cs.CL 74%

Polymer-Agent: Large Language Model Agent for Polymer Design

聚合物代理:用于聚合物设计的大型语言模型代理

Vani Nigam, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出基于LLM的聚合物代理,通过结构-性质预测和生成技术,助力实验室研究人员高效发现新型聚合物结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04220 2026-02-03 cs.CL 74%

On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement

关于代理搜索中群体相对策略优化崩溃:懒惰似然位移

Wenlong Deng, Yushu Li, Boying Gong, Yi Ren, Christos Thrampoulidis, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Meta AI

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出LLDS正则化方法,解决GRPO在代理搜索中因LLD导致的训练崩溃问题,提升模型性能达45.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13059 2025-12-16 cs.CL 74%

An Open and Reproducible Deep Research Agent for Long-Form Question Answering

一个开放且可重复的深度研究代理用于长格式问答

Ikuya Yamada, Wataru Ikeda, Ko Yoshida, Mengyu Ye, Hinata Sugimoto, Masatoshi Suzuki, Hisanori Ozaki, Jun Suzuki

机构 * Studio Ousia(Ousia工作室) Tohoku University(东京大学) DENTSU SOKEN INC.(DENTSU SOKEN公司) RIKEN(日本学术振兴会) NII LLMC(日本信息处理学会LLMC)

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。

Comments Technical report of a winning system in the NeurIPS MMU-RAG competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08706 2025-12-10 cs.SE 74%

RESTifAI: LLM-Based Workflow for Reusable REST API Testing

RESTifAI:基于大语言模型的可重用REST API测试工作流

Leon Kogler, Maximilian Ehrhart, Benedikt Dornauer, Eduard Paul Enoiu

专题命中 工具调用 :workflow(title);分类 cs.SE

AI总结 RESTifAI是一种基于大语言模型的工具,用于生成可重用且适用于CI/CD的REST API测试,通过系统性构建测试场景并验证功能和鲁棒性。

Comments Accepted for ICSE 2026 Demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27569 2025-11-03 cs.CL 74%

MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval

Qi Luo, Xiaonan Li, Yuxin Wang, Tingshuo Fan, Yuan Li, Xinchi Chen, Xipeng Qiu

机构 * School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 工具调用 :agentic(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17052 2025-10-21 cs.AI 74%

ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems

Hassan Hamad, Yingru Xu, Liang Zhao, Wenbo Yan, Narendra Gyanchandani

机构 * Amazon(亚马逊)

专题命中 工具调用 :tool-use(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15692 2025-08-29 cs.LG 74%

MLE-STAR: Machine Learning Engineering Agent via Search and Targeted Refinement

Jaehyun Nam, Jinsung Yoon, Jiefeng Chen, Jinwoo Shin, Sercan Ö. Arık, Tomas Pfister

机构 * Google Cloud(谷歌云) KAIST(韩国科学技术院)

专题命中 工具调用 :agent(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13121 2025-08-19 cs.AI 74%

Bayesian Optimization-based Search for Agent Control in Automated Game Testing

Carlos Celemin

机构 * Production R\&D, Tencent Amsterdam, Netherlands

专题命中 工具调用 :agent(title);分类 cs.AI

Journal ref 2024 IEEE Conference on Games (CoG), Milan, Italy, 2024, pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10570 2025-05-19 cs.SE 74%

LongFuncEval: Measuring the effectiveness of long context models for function calling

Kiran Kate, Tejaswini Pedapati, Kinjal Basu, Yara Rizk, Vijil Chenthamarakshan, Subhajit Chaudhury, Mayank Agarwal, Ibrahim Abdelaziz

专题命中 工具调用 :function calling(title);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07184 2025-05-13 cs.CL 74%

Structural Entropy Guided Agent for Detecting and Repairing Knowledge Deficiencies in LLMs

Yifan Wei, Xiaoyan Yu, Tengfei Pan, Angsheng Li, Li Du

机构 * State Key Laboratory of CCSE,School of Computer Science and Engineering,Beihang University(信息与通信系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Institute of Technology(北京理工大学)

专题命中 工具调用 :agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08752 2025-04-15 cs.IR cs.AI 74%

Patience is all you need! An agentic system for performing scientific literature review

David Brett, Anniek Myatt

专题命中 工具调用 :agentic(title);分类 cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏