arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5014 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2412.12151 2024-12-18 cs.LG cs.AI cs.SE 82%

SMARTCAL: An Approach to Self-Aware Tool-Use Evaluation and Calibration

Yuanhao Shen, Xiaodan Zhu, Lei Chen

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI、cs.LG、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00636 2024-09-04 cs.IR cs.MA 82%

A Learnable Agent Collaboration Network Framework for Personalized Multimodal AI Search Engine

Yunxiao Shi, Min Xu, Haimin Zhang, Xing Zi, Qiang Wu

专题命中 工具调用 :agent(title,abstract);AI agent(abstract)

Comments ACMMM 2024 MMGR WORKSHOP

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04455 2024-06-05 cs.CL cs.AI cs.LG 82%

Fortify the Shortest Stave in Attention: Enhancing Context Awareness of Large Language Models for Effective Tool Use

Yuhan Chen, Ang Lv, Ting-En Lin, Changyu Chen, Yuchuan Wu, Fei Huang, Yongbin Li, Rui Yan

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ACL 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20245 2024-05-31 cs.CL cs.AI cs.IR cs.LG 82%

Retrieval Augmented Structured Generation: Business Document Information Extraction As Tool Use

Franz Louis Cesista, Rui Aguiar, Jason Kim, Paolo Acilo

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted by IEEE 7th International Conference on Multimedia Information Processing and Retrieval (MIPR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06907 2024-05-24 cs.CL cs.AI cs.LG cs.PL 82%

AIOS Compiler: LLM as Interpreter for Natural Language Programming and Flow Programming of AI Agents

Shuyuan Xu, Zelong Li, Kai Mei, Yongfeng Zhang

专题命中 工具调用 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 12 pages, 6 figures, comments and suggestions are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19291 2024-05-01 cs.HC 82%

Dynamic Human Trust Modeling of Autonomous Agents With Varying Capability and Strategy

Jason Dekarske, Zhaodan Kong, Sanjay Joshi

专题命中 工具调用 :autonomous agent(title,abstract);agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12587 2023-02-27 cs.RO cs.SY eess.SY 82%

3D Trajectory Planning for UAV-based Search Missions: An Integrated Assessment and Search Planning Approach

Savvas Papaioannou, Panayiotis Kolios, Theocharis Theocharides, Christos G. Panayiotou, Marios M. Polycarpou

专题命中 工具调用 :planning(title,abstract);agent(abstract)

Comments 2021 International Conference on Unmanned Aircraft Systems (ICUAS)

Journal ref 2021 International Conference on Unmanned Aircraft Systems (ICUAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01895 2022-01-19 eess.SY cs.MA cs.RO cs.SY math.OC 82%

Three-agent Time-constrained Cooperative Pursuit-Evasion

Abhinav Sinha, Shashi Ranjan Kumar, Dwaipayan Mukherjee

专题命中 工具调用 :agent(title,abstract);planning(abstract)

Comments The most recent version of this article can be viewed at https://doi.org/10.1007/s10846-022-01570-y

Journal ref published in Journal of Intelligent & Robotic Systems (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14282 2021-12-01 cs.CL cs.AI cs.LG 82%

Customer Sentiment Analysis using Weak Supervision for Customer-Agent Chat

Navdeep Jain

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02467 2020-04-22 quant-ph cond-mat.dis-nn 82%

Neural network agent playing spin Hamiltonian games on a quantum computer

Oleg M. Sotnikov, Vladimir V. Mazurenko

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract)

Comments Local spin correction procedure was used to compensate real device errors; comparison with variational approach was added

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.07276 2018-04-20 cs.RO 82%

Static and Dynamic Path Planning Using Incremental Heuristic Search

Asem Khattab

专题命中 工具调用 :planning(title,abstract);agent(abstract)

Comments Internship Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07528 2026-06-23 cs.CL cs.AI 版本更新 82%

From RAG to Agentic RAG for Faithful Islamic Question Answering

从RAG到智能体RAG:面向可靠的伊斯兰问答

Gagan Bhatia, Hamdy Mubarak, Mustafa Jarrar, George Mikros, Fadi Zaraket, Mahmoud Alhirthani, Mutaz Al-Khatib, Logan Cochrane, Kareem Darwish, Rashid Yahiaoui, Firoj Alam

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。

Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17099 2026-06-17 cs.SE cs.AI 新提交 82%

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

软件委托合约:衡量AI编码代理工作中的可审查性

Vincent Schmalbach

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。

Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23876 2026-03-02 cs.AI cs.LG 82%

RF-Agent: Automated Reward Function Design via Language Agent Tree Search

RF-Agent: 通过语言代理树搜索实现自动奖励函数设计

Ning Gao, Xiuhui Zhang, Xingyu Jiang, Mukang You, Mohan Zhang, Yue Deng

机构 * Beihang University(北航大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 RF-Agent通过语言代理树搜索实现自动奖励函数设计,利用蒙特卡洛树搜索和LLMs的上下文推理能力,提升低层控制任务的奖励函数设计效率和效果。

Comments 39 pages, 9 tables, 11 figures, Project page see https://github.com/deng-ai-lab/RF-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 81%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 工具调用 :agentic(abstract,abstract_cn);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 81%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 81%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12674 2026-06-12 cs.AI 新提交 81%

Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

Evoflux: 紧凑型智能体的可执行工具工作流的推理时演化

Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);function calling(abstract)

AI总结 提出Evoflux,一种推理时演化搜索方法,通过结构化编辑和执行反馈修复紧凑语言模型的工具工作流,将执行可行性从3%提升至17-24%,优于SFT和ReAct。

Comments Code is available at https://github.com/IBM/Evoflux

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新 81%

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);workflow(abstract)

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16856 2026-05-20 cs.AI 81%

Distributional AGI Safety

分布式AGI安全

Nenad Tomašev, Matija Franklin, Julian Jacobs, Sébastien Krier, Simon Osindero

机构 * Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agent(abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出了一种分布式的AGI安全框架,旨在通过设计和实现虚拟代理沙盒经济来应对群体代理协调带来的安全风险,强调市场机制、可审计性和监管的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17746 2026-05-19 cs.AI cs.HC 81%

Agents for Experiments, Experiments for Agents: A Design Grammar for AI-Enabled Experimental Science

实验中的代理,代理中的实验:一种面向人工智能增强型实验科学的设计语法

Yingjie Zhang, Chun Feng, Weizhang Zhu, Tianshu Sun

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Xi'an Jiaotong University(西安交通大学) Cheung Kong Graduate School of Business(长江商学院)

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出SEED框架,用于表示实验条件为类型化的代理-流程图,以支持实验设计的自动化生成和评估,通过在医疗分诊任务中的实验证明其有效性,并讨论了新颖性、可重复性等治理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17734 2026-05-19 cs.AI 81%

Harnessing LLM Agents with Skill Programs

通过技能程序 harnessing LLM agents

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

机构 * New York University(纽约大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 工具调用 :agent(summary_cn,abstract);分类 cs.AI

AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 81%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18334 2026-04-21 cs.SE 81%

Reliability of AI Bots Footprints in GitHub Actions CI/CD Workflows

GitHub Actions CI/CD 工作流中 AI 机器人足迹的可靠性

Syed Muhammad Ashhar Shah, Sehrish Habib, Muizz Hussain, Maryam Abdul Ghafoor, Abdul Ali Bangash

专题命中 工具调用 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究分析了AI机器人在GitHub Actions CI/CD工作流中的可靠性,发现不同AI机器人成功率差异显著,且高频的AI PR可能影响工作流可靠性。

Comments 5 pages, 3 figures. Submitted to the 23rd International Conference on Mining Software Repositories (MSR 2026) Mining Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG 81%

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09611 2026-04-14 cs.DC cs.AI 81%

Characterizing Performance-Energy Trade-offs of Large Language Models in Multi-Request Workflows

刻画大规模语言模型在多请求工作流中的性能-能耗权衡

Md. Monzurul Amin Ifath, Israat Haque

机构 * Dalhousie University(达尔豪斯大学)

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文研究了多请求工作流中大规模语言模型的性能与能耗权衡,通过四个代表性工作负载分析关键能耗参数对延迟、吞吐量和组件能耗的影响,揭示了批处理大小、GPU供电限制和引擎优化对能耗的差异影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI 81%

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);multi-agent(abstract)

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01119 2026-02-03 cs.CL 81%

Tendem: A Hybrid AI+Human Platform

Tendem:一种混合AI+人类平台

Konstantin Chernyshev, Ekaterina Artemova, Viacheslav Zhukov, Maksim Nerush, Mariia Fedorova, Iryna Repik, Olga Shapovalova, Aleksey Sukhorosov, Vladimir Dobrovolskii, Natalia Mikhailova, Sergei Tilga

机构 * Toloka Team(Toloka团队)

专题命中 工具调用 :agent(abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 Tendem通过结合AI与人类专家,实现了在复杂任务中高质量、高效率的输出,同时保持与纯人力执行相当的成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07072 2026-01-13 cs.CR cs.AI 81%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07094 2025-12-10 cs.AI 81%

VIGIL: A Reflective Runtime for Self-Healing Agents

VIGIL:一种用于自愈代理的反射性运行时

Christopher Cruz

机构 * Christopher Cruz

专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)

AI总结 VIGIL是一种反射性运行时,通过自我诊断和修复机制提升代理系统的可靠性和自我维护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏