arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 92539 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2512.20135 2025-12-25 cs.AI 85%

MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization

MolAct:一种用于分子编辑和性质优化的代理强化学习框架

Zhuo Yang, Yeyun Chen, Jiaqing Xie, Ben Gao, Shuaike Shen, Wanhao Liu, Liujia Yang, Beilun Wang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 MolAct框架通过代理强化学习方法,实现了分子编辑和性质优化的多步骤、工具增强过程,提升了分子设计的可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04371 2025-10-07 cs.AI cs.DC cs.MA 85%

Speculative Actions: A Lossless Framework for Faster Agentic Systems

Naimeng Ye, Arnav Ahuja, Georgios Liargkovas, Yunan Lu, Kostis Kaffes, Tianyi Peng

机构 * Columbia University(哥伦比亚大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18884 2025-07-28 cs.CL 85%

MindFlow+: A Self-Evolving Agent for E-Commerce Customer Service

Ming Gong, Xucheng Huang, Ziheng Xu, Vijayan K. Asari

机构 * Xiaoduo AI Lab, Shanghai, China(小多AI实验室,上海,中国) University of Dayton, Dayton, Ohio, United States(Dayton大学,俄亥俄州,美国)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17320 2025-06-24 cs.CY cs.CV cs.LG 85%

MAARTA:Multi-Agentic Adaptive Radiology Teaching Assistant

Akash Awasthi, Brandon V. Chang, Anh M. Vu, Ngan Le, Rishi Agrawal, Zhigang Deng, Carol Wu, Hien Van Nguyen

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.LG

Comments Accepted to MICCAI 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14728 2025-06-18 cs.AI 85%

AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes

Jiahao Qiu, Xinzhe Juan, Yimin Wang, Ling Yang, Xuan Qi, Tongcheng Zhang, Jiacheng Guo, Yifu Lu, Zixin Yao, Hongru Wang, Shilong Liu, Xun Jiang, Liu Leqi, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong(香港中文大学) Tianqiao and Chrissy Chen Institute(田桥和克里斯蒂·陈研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01562 2025-05-29 cs.LG 85%

Memento No More: Coaching AI Agents to Master Multiple Tasks via Hints Internalization

Minttu Alakuijala, Ya Gao, Georgy Ananov, Samuel Kaski, Pekka Marttinen, Alexander Ilin, Harri Valpola

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22931 2025-04-03 cs.AI 85%

Factored Agents: Decoupling In-Context Learning and Memorization for Robust Tool Use

Nicholas Roth, Christopher Hidey, Lucas Spangher, William F. Arnold, Chang Ye, Nick Masiewicki, Jinoo Baek, Peter Grabowski, Eugene Ie

专题命中 工具调用 :tool use(title);agent(abstract);planning(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08435 2025-03-04 cs.AI 85%

Automated Design of Agentic Systems

Shengran Hu, Cong Lu, Jeff Clune

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

Comments Website: https://shengranhu.com/ADAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08772 2024-04-23 cs.AI cs.MA 85%

Optimal Task Assignment and Path Planning using Conflict-Based Search with Precedence and Temporal Constraints

Yu Quan Chong, Jiaoyang Li, Katia Sycara

专题命中 工具调用 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06443 2022-11-15 cs.LG cs.RO 85%

Learning Reward Models for Cooperative Trajectory Planning with Inverse Reinforcement Learning and Monte Carlo Tree Search

Karl Kurzer, Matthias Bitzer, J. Marius Zöllner

专题命中 工具调用 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.00745 2022-03-08 cs.RO cs.AI 85%

Multi-objective Conflict-based Search Using Safe-interval Path Planning

Zhongqiang Ren, Sivakumar Rathinam, Maxim Likhachev, Howie Choset

专题命中 工具调用 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 85%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.SE;agentic(comments)

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06396 2025-07-10 cs.AI cs.LG cs.PL cs.SE 85%

Representing Prompting Patterns with PDL: Compliance Agent Case Study

Mandana Vaziri, Louis Mandel, Yuji Watanabe, Hirokuni Kitahara, Martin Hirzel, Anca Sailer

机构 * IBM Research, Yorktown Heights, USA(IBM研究院,Yorktown Heights,美国) IBM Research, Tokyo, Japan(IBM研究院,Tokyo,日本)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

Comments ICML 2025 Workshop on Programmatic Representations for Agent Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08557 2025-08-15 cs.IR cs.CL cs.LG cs.MA 85%

A New Query Expansion Approach via Agent-Mediated Dialogic Inquiry

Wonduk Seo, Hyunjin An, Seunghyun Lee

机构 * Enhans Seoul, South Korea(首尔增强韩国)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.CL、cs.LG;AI agent(comments)

Comments Accepted by ACM SIGKDD 2025 Workshop on AI Agent for Information Retrieval (Agent4IR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11857 2023-02-07 cs.AI cs.LG cs.MA 85%

Policy-Value Alignment and Robustness in Search-based Multi-Agent Learning

Niko A. Grupen, Michael Hanlon, Alexis Hao, Daniel D. Lee, Bart Selman

专题命中 工具调用 :agent(title);multi-agent(title);分类 cs.AI、cs.LG

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.04825 2021-03-23 cs.RO cs.AI cs.LG eess.SP 85%

Multi-Agent Active Search using Realistic Depth-Aware Noise Model

Ramina Ghods, William J. Durkin, Jeff Schneider

专题命中 工具调用 :agent(title);multi-agent(title);分类 cs.AI、cs.LG

Comments To appear at the 2021 IEEE International Conference on Robotics and Automation (ICRA), extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 85%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15485 2026-08-10 cs.CY cs.AI cs.HC cs.LG cs.SE 版本更新 85%

The Perils of Agency: How Developers Perceive, Prioritize, and Address Risks in Agentic AI Products

代理的风险:开发者如何感知、优先级排序和应对代理型AI产品中的风险

Hao-Ping Lee, Jessica He, David Piorkowski, Thomas Serban von Davier, Jodi Forlizzi, Sauvik Das

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 通过35位行业开发者的研究,发现开发者对代理型AI风险的感知与自主性、工具使用等代理特性紧密相关,他们优先考虑产品和业务风险,缺乏成熟的控制手段,揭示了代理能力与风险控制之间的张力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 85%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 工具调用 :agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19021 2026-07-21 cs.CR 版本更新 85%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11520 2026-07-15 cs.CL cs.AI cs.LG 版本更新 85%

ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories

ISE:一种基于执行的多轮操作系统代理轨迹合成方法

Siyuan Luo, Nairong Zheng, Lin Zhou, Tiankuo Yao, Shengyou Yuan, Haojia Yu, Cong Pang, Jiapeng Luo, Lewei Lu

机构 * University of Electronic Science and Technology of China(电子科技大学) SenseTime Research(商汤科技研究院)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ISE三阶段范式,通过结构化意图构建、角色锁定用户模拟和真实执行环境,生成多轮代理轨迹,微调后显著提升代理工具使用性能。

Comments 13 pages, 6 figures. Dataset and code: https://github.com/Valiere01/ISE-Trace

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22897 2026-07-03 cs.AI cs.CL cs.CV cs.LG cs.MM 版本更新 85%

OmniGAIA: Towards Native Omni-Modal AI Agents

OmniGAIA:迈向原生全模态AI代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Haoxuan Li, Hao Wang, Shijian Wang, Guanting Dong, Jiajie Jin, Yinuo Wang, Yuan Lu, Ji-Rong Wen, Zhicheng Dou, Zhouchen Lin

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Peking University(北京大学) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 工具调用 :AI agent(title);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00887 2026-06-16 cs.CL cs.AI cs.LG 版本更新 85%

EffGen: Enabling Small Language Models as Capable Autonomous Agents

EffGen: 使小型语言模型成为能干的自主智能体

Gaurav Srivastava, Aafiya Hussain, Chi Wang, Yingyan Celine Lin, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Google DeepMind, USA(谷歌DeepMind)

专题命中 工具调用 :autonomous agent(title);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。

Comments Accepted to ICML 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 85%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01838 2026-06-02 cs.CL cs.AI cs.LG 85%

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型

Prateek Kumar Sikdar

机构 * Accenture(埃森哲)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01801 2026-06-02 cs.MA 85%

MetaForge: A Self-Evolving Multimodal Agent that Retrieves, Adapts, and Forges Tools On Demand

MetaForge:一种自我进化的多模态智能体,可按需检索、适应和锻造工具

Shouang Wei, Houcheng Min, Xinpeng Dong, Xin Lin, Sen Cui, Bo Jiang, Zhongxiang Dai, Kun Kuang, Guandong Xu, Fei Wu, Min Zhang

专题命中 工具调用 :agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 提出MetaForge框架,通过决策-检索-适应-锻造-回收的闭环机制,使多模态智能体能够按需自我进化工具集,在12个基准测试中超越16个基线方法,提升了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01444 2026-06-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG math.CT 85%

Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence

科学中的自我修正发现系统:面向主体人工智能的范畴论框架

Fiona Y. Wang, Markus J. Buehler

机构 * Laboratory for Atomistic and Molecular Mechanics(原子分子力学实验室) Department of Biological Engineering(生物工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering(机械工程系) Center for Computational Science and Engineering(计算科学与工程中心) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一个基于范畴论的框架,通过左Kan扩展实现科学发现中的表征体制转换,并应用于材料科学中的蛋白质力学和纤维网络建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09572 2026-05-28 cs.AI cs.LG cs.SE 85%

SynthTools: A Framework for Scaling Synthetic Tools for Agent Development

SynthTools: 用于扩展智能体开发中合成工具的框架

Tommaso Castellani, Naimeng Ye, Daksh Mittal, Thomson Yen, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

专题命中 工具调用 :agent(title);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出基于LLM的端到端管道SynthTools,通过环境生成、模拟、验证和任务构建,生成大规模多样化工具使用环境,提升智能体工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14757 2026-05-19 eess.SP 85%

ChannelAgent-Empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

ChannelAgent-empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

Mingyue Li, Li Yu, Yuxiang Zhang, Heng Wang, Jianhua Zhang, Ping Zhang, Guangyi Liu

专题命中 工具调用 :agent(title,title_cn)

AI总结 本文提出了一种基于ChannelAgent的电磁空间世界模型,用于6G AI原生空气接口中的智能体驱动信道生成,通过多模感知、ChannelAgent智能核心和反馈更新的闭环过程,实现任务感知决策和自主适应。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21265 2026-05-19 cs.CL cs.LG cs.SE 85%

ToolMATH: A Diagnostic Benchmark for Long-Horizon Tool Use under Systematic Tool-Catalog Constraints

ToolMATH: 一种用于在系统性工具目录约束下评估长周期工具使用的诊断基准

Hyeonje Choi, Jeongsoo Lee, Hyojun Lee, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学)

专题命中 工具调用 :tool use(title,abstract);tool-use(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 本文提出ToolMATH,一种基于数学的诊断基准,用于评估在可控工具目录条件下长周期工具使用的性能,通过将分步MATH解决方案转换为可重用的Python工具,并配对需要顺序工具使用、中间输出重用和逻辑连接工具调用链的问题,从而评估模型在不同工具目录条件下的适应性、鲁棒性和工具连接性。

Comments Submitted to NeurIPS Evaluation & Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏