arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-04 至 2026-06-04 共收录 1118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 27 篇

2606.04056 2026-06-04 cs.SE cs.MA cs.PL 89%

Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study

Token Budgets: 63个LLM-Agent预算超支事件的实证目录,以及一个仿射类型化Rust缓解案例研究

Sajjad Khan

专题命中 工具调用 :agent(title,title_cn);multi-agent(abstract);分类 cs.SE

AI总结 通过分析21个编排框架中的63个生产事故,提出一个八类故障分类法,并构建一个基于仿射类型的Rust库(token-budgets)来在编译时防止预算超支,实验证明其不可绕过性。

Comments 26 pages. Artifact (catalog CSV, Rust crate, formal proofs): https://github.com/sajjadanwar0/token-budgets

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05037 2026-06-04 cs.SE cs.AI 88%

Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery

自反式API:结构优于冗长,助力AI代理恢复

Arquimedes Canedo, Grama Chethan

机构 * Siemens Digital Industries Software, USA(西门子数字工业软件公司)

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出自反式API,在验证失败时返回机器可读的结构化建议,使AI代理无需外部推理即可修复请求并重试,在Anthropic模型上将任务完成率提升36.7-40.0个百分点,且每成功令牌效率提升1.8-2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04051 2026-06-04 cs.LG cs.AI cs.CR 88%

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS: 基于评分标准的强化学习用于智能体安全

Xian Qi Loye, Qinglin Su, Zhexin Zhang, Shiyao Cui, Qi Zhu, Fei Mi, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 提出RUBAS框架,通过将智能体行为分解为四个维度的评分标准提供细粒度奖励,利用强化学习在保证任务完成的同时提升工具使用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04781 2026-06-04 cs.AI cs.LG 86%

AIP: A Graph Representation for Learning and Governing Agent Skills

AIP: 一种用于学习和治理智能体技能的图表示

Zachary Blumenfeld, Jim Webber

机构 * Neo4j USA(Neo4j美国公司) Neo4j UK(Neo4j英国公司)

专题命中 工具调用 :agent(title,summary_cn);分类 cs.AI、cs.LG

AI总结 提出Agent指令协议(AIP),将有向执行图作为技能表示,通过编译人类编写的技能提升任务表现,并支持技能的可诊断修复与治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04315 2026-06-04 cs.AI 83%

Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline

探索智能体记忆系统的跨场景通用性:诊断与强基线

Zhikai Chen, Jialiang Gu, Junyu Yin, Xianxuan Long, Shenglai Zeng, Xiaoze Liu, Kai Guo, Keren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) George Mason University(乔治·马歇尔大学) Purdue University(普渡大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 通过诊断现有记忆系统在多种场景下的表现,提出一个基于工具调用的自管理记忆框架AutoMEM,实现最佳跨场景通用性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.09952 2026-06-04 eess.SY cs.HC cs.SY 82%

Agent-Based Modeling and Simulation of Connected and Automated Vehicles Using Game Engine: A Cooperative On-Ramp Merging Study

基于游戏引擎的连接和自动化车辆的代理建模与仿真:一种合作匝道合并研究

Ziran Wang, BaekGyu Kim, Hiromitsu Kobayashi, Guoyuan Wu, Matthew J. Barth

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract)

AI总结 本文提出了一种基于游戏引擎Unity3D的连接和自动化车辆(CAVs)的代理建模与仿真方法,通过分布式共识协议研究了合作匝道合并问题,并与人类在回路模拟进行了比较,结果显示该协议在减少旅行时间、能源消耗和污染物排放方面具有显著优势。

Comments 14 pages, 6 figures. 2019 Transportation Research Board Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04104 2026-06-04 cs.SE cs.AI cs.CR 81%

Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems

证明携带型智能体动作:异构智能体系统的模型无关运行时治理

Zexun Wang

机构 * Ond Holdings Inc(Ond控股公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出一种运行时无关的治理模型PCAA,通过动作证书和五个检查点实现异构智能体系统的统一授权与审计,并在参考实现中验证其可移植性和有效性。

Comments 25 pages, 2 tables, 3 figures. Implementation-informed systems paper with bounded public validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04840 2026-06-04 physics.optics 78%

Reinforcement Learning-Enabled Agent for Transmitter Optimization in Digital-Analog Radio-over-Fiber Fronthaul

强化学习驱动的数字-模拟光载射频前传发射机优化智能体

Junhao Zhao, Huayuan Qin, Ouhan Huang, Zhongya Li, Chengxi Wang, Boyu Dong, Liangtao Chen, Xuyu Deng, An Yan, Penghao Luo, Renle Zheng, Yongzhu Hu, Aolong Sun, Yinjun Liu, Sizhe Xing, Nan Chi, Junwen Zhang

专题命中 工具调用 :agent(title,abstract)

AI总结 针对数字-模拟光载射频前传中多个耦合参数难以优化的问题,提出一种基于强化学习的智能体架构,通过端到端信噪比反馈自主学习最优发射机参数,实验证明其能稳定提升信噪比并支持高阶调制格式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03892 2026-06-04 cs.CL cs.AI cs.LG 78%

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments

合成与奖励——面向实时环境中多步骤工具使用的强化学习

Ibrahim Abdelaziz, Asim Munawar, Kinjal Basu, Maxwell Crouse, Chulaka Gunasekara, Suneet Katrekar, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PROVE框架,通过20个有状态MCP服务器、自动化数据合成流水线和多组件程序化奖励,解决多步骤工具调用中的环境构建、查询生成和奖励设计问题,在BFCL Multi-Turn、tau2-bench和T-Eval上分别提升最多+10.2、+6.8和+6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 73%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 62%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04271 2026-06-04 cs.CV cs.AI 57%

StandardE2E: A Unified Framework for End-to-End Autonomous Driving Datasets

StandardE2E:端到端自动驾驶数据集的统一框架

Stepan Konev

机构 * University of Cambridge(剑桥大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出StandardE2E框架,通过统一数据模式、多数据集联合加载和简化新数据集添加流程,解决端到端自动驾驶数据集格式不兼容问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03318 2026-06-04 cs.CL 57%

Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

超越理想指令:现实交互中评估大语言模型的综合框架

Xuan Yang, Hao Xu, Tingfeng Hui, Hongsheng Xin, Kaike Zhang, Chunxiao Liu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究员)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 提出RUT-Bench基准,通过高保真模拟理想与非理想用户行为,评估大语言模型在现实工具调用场景中的表现,发现所有测试模型成功率低于40%且面对复杂非理想输入时性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00727 2026-06-04 cs.RO cs.AI cs.SY eess.SY 57%

Closed-loop Bayesian Semantic Data Fusion for Collaborative Human-Autonomy Target Search

闭环贝叶斯语义数据融合用于协同人机目标搜索

Luke Burks, Ian Loefgren, Luke Barbier, Jeremy Muesing, Jamison McGinley, Sousheel Vunnam, Nisar Ahmed

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文提出一种闭环贝叶斯语义数据融合方法,通过CPOMDP规划生成最优轨迹,结合不完美传感器数据和人类提供的语义观察,提升动态目标搜索效率。

Comments Final version accepted and submitted to 2018 FUSION Conference (Cambridge, UK, July 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00221 2026-06-04 econ.GN cs.LG nlin.AO q-fin.EC 57%

The Coconut Model with Heterogeneous Strategies and Learning

带有异质策略和学习的椰子模型

Sven Banisch, Eckehard Olbrich

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本文基于Diamond搜索均衡模型开发了基于代理的版本,探讨了异质适应性和适应性预期对非均衡轨迹的影响,并展示了系统收敛到原系统固定点的稳定性。

Comments Accepted for publication in the Journal of Artificial Societies and Social Simulation (JASSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.06789 2026-06-04 stat.ML cs.AI cs.SY eess.SY math.OC 57%

Information-Theoretic Bounded Rationality

信息论有界理性

Pedro A. Ortega, Daniel A. Braun, Justin Dyer, Kee-Eung Kim, Naftali Tishby

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 本文基于信息论提出有界理性的理论,通过自由能函数描述决策,具备控制解空间、精确蒙特卡洛规划及捕捉模型不确定性的特性,并扩展至序列决策。

Comments 47 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04300 2026-06-04 cs.IR 50%

Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval

Argus-Retriever: 基于区域感知查询条件混合专家模型的视觉-大语言模型后期交互检索用于视觉文档检索

Abdelrahman Abdallah, Mahmoud Abdalla, Mohammed Ali, Adam Jatowt

专题命中 工具调用 :agentic(abstract)

AI总结 提出Argus系列查询条件后期交互检索器,通过区域感知混合专家模块使文档表示依赖查询,在ViDoRe基准上以更低维度和更少训练数据取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.03688 2026-06-04 physics.comp-ph cs.CE cs.NA math.NA physics.class-ph 50%

On the optimal experimental design for heat and moisture parameter estimation

关于用于热和湿度参数估计的最优实验设计

Julien Berger, Denys Dutykh, Nathan Mendes

专题命中 工具调用 :planning(abstract)

AI总结 本文提出最优实验设计的概念,旨在通过传感器数量和位置以及边界条件来优化实验条件,以提高参数估计的准确性,应用于纯导热和热-湿度耦合传热两种情况。

Comments 32 pages, 14 figures, 3 tables, 34 references. Other author's papers can be downloaded at http://www.denys-dutykh.com/

Journal ref Experimental Thermal and Fluid Science (2017), Vol. 81, pp. 109-122

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05728 2026-06-04 cs.RO cs.SY eess.SY 50%

Technical Report: Safe, Aggressive Quadrotor Flight via Reachability-based Trajectory Design

技术报告:基于可达性的安全激进四旋翼飞行轨迹设计

Shreyas Kousik, Patrick Holmes, Ramanarayan Vasudevan

机构 * Mechanical Engineering, University of Michigan, Ann Arbor, MI(机械工程,密歇根大学,安娜堡,MI)

专题命中 工具调用 :planning(abstract)

AI总结 本文提出了一种基于可达性的四旋翼飞行轨迹设计方法,通过在线规划中创新性地使用Zonotopes来确保在存在轨迹依赖性跟踪误差的情况下飞行安全,实验显示在500个随机复杂环境中实现了最高5m/s的激进飞行且无碰撞。

Comments 12 Pages, 3 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06873 2026-06-04 eess.SY cs.CR cs.LO cs.SY 50%

Secure Control under Partial Observability with Temporal Logic Constraints

在存在时间逻辑约束下的部分可观测环境中的安全控制

Bhaskar Ramasubramanian, Andrew Clark, Linda Bushnell, Radha Poovendran

专题命中 工具调用 :agent(abstract)

AI总结 本文研究了在存在对手的情况下,代理在部分可观测环境中满足时间逻辑规范的控制策略合成问题,通过有限状态控制器空间中的搜索方法来确定策略,以最大化满足给定的时间逻辑规范。

Comments To appear at the American Control Conference, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.03517 2026-06-04 math.OC cs.SY eess.SY 50%

A Submodular Approach for Electricity Distribution Network Reconfiguration

为电力分配网络重构的子模方法

Ali Khodabakhsh, Ger Yang, Soumya Basu, Evdokia Nikolova, Michael C. Caramanis, Thanasis Lianeas, Emmanouil Pountourakis

专题命中 工具调用 :tool use(abstract)

AI总结 本文提出利用子模函数最小化方法解决电力分配网络重构中的损耗最小化问题,证明该问题为强NP难,并提出多项式时间局部搜索算法,理论分析其性能并验证与传统分支交换算法等效。

Comments 10 pages, 6 figures, to appear in 51st Hawaii International Conference on System Sciences (HICSS), Hawaii, USA, Jan. 3-6, 2018

Journal ref HICSS 51 (2018) 2717-2726

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.06844 2026-06-04 math.NA cs.NA 50%

Spectral analysis and multigrid preconditioners for two-dimensional space-fractional diffusion equations

二维空间分数扩散方程的谱分析及多网格预处理子

Hamid Moghaderi, Mehdi Dehghan, Marco Donatelli, Mariarosa Mazza

专题命中 工具调用 :tool use(abstract)

AI总结 本文研究二维空间分数扩散方程的离散化问题,通过谱分析设计多网格预处理子,证明其收敛性,并验证其在Krylov方法中的有效性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.07610 2026-06-04 cs.CG cs.CC cs.RO cs.SY eess.SY 50%

Efficient Nearest-Neighbor Search for Dynamical Systems with Nonholonomic Constraints

动态系统非holonomic约束下的高效最近邻搜索

Valerio Varricchio, Brian Paden, Dmitry Yershov, Emilio Frazzoli

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :planning(abstract)

AI总结 本文研究了非holonomic约束动态系统中最近邻搜索的复杂性,发现传统k-d树在子里曼度量下查询复杂度为Θ(N^p log N),提出针对性改进策略提升效率。

Comments 16 pages, 3 figures, the 12th Workshop on the Algorithmic Foundations of Robotics (WAFR) 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.02650 2026-06-04 eess.SY cs.RO cs.SY 50%

An MILP Approach for Real-time Optimal Controller Synthesis with Metric Temporal Logic Specifications

基于混合整数线性规划的实时最优控制器综合方法:带有度量时序逻辑规范

Sayan Saha, A. Agung Julius

专题命中 工具调用 :planning(abstract)

AI总结 本文提出一种混合整数线性规划方法,用于在动态环境中实时合成满足度量时序逻辑规范的控制器,通过优化性能指标确保系统行为正确。

Comments American Control Conference 2016 (extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.08474 2026-06-04 eess.SY cs.LO cs.RO cs.SY 50%

Control with Probabilistic Signal Temporal Logic

基于概率信号时间逻辑的控制

Chanyeol Yoo, Calin Belta

专题命中 工具调用 :autonomous agent(abstract)

AI总结 本文提出概率信号时间逻辑用于连续信念空间中的复杂任务控制,设计高效合成算法以最大化任务满足概率,并通过无人机仿真验证。

Comments 7 pages, submitted to the 2016 American Control Conference (ACC 2016) on September, 30, 2015 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
1311.6005 2026-06-04 eess.SY cs.SY 50%

Modeling and Simulation of the EV Charging in a Residential Distribution Power Grid

住宅配电网中电动汽车充电的建模与仿真

Fereidoun Ahourai, Irvin Huang, Mohammad Abdullah Al Faruque

专题命中 工具调用 :tool use(abstract)

AI总结 本文通过GridLAB-D工具研究电动汽车高渗透率对住宅配电网的影响,提出无需升级的协调充电方法以解决变压器过载问题。

Comments Proceedings of Green Energy and Systems Conference 2013, November 25, Long Beach, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
1308.3015 2026-06-04 cs.RO cs.SY eess.SY stat.CO stat.ME 50%

On Generalized Bayesian Data Fusion with Complex Models in Large Scale Networks

在大规模网络中使用复杂模型的广义贝叶斯数据融合

Nisar Ahmed, Tsung-Lin Yang, Mark Campbell

机构 * 1 Sibley School of Mechanical

专题命中 工具调用 :autonomous agent(abstract)

AI总结 本文提出新的广义贝叶斯分布式数据融合算法,用于处理动态网络拓扑和复杂信念模型,通过混合pdf和条件因子提升多机器人目标搜索中的融合效果。

Comments Revised version of paper submitted to 2013 Workshop on Wireless Intelligent Sensor Networks (WISeNET 2013) at Duke University, June 5, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 370 篇

2602.17434 2026-06-04 eess.SY cs.MA cs.SY 91%

Multi-Agent Temporal Logic Planning via Penalty Functions and Block-Coordinate Optimization

基于惩罚函数和块坐标优化的多主体时序逻辑规划

Eleftherios E. Vlahakis, Arash Bahari Kordabad, Lars Lindemann, Pantelis Sopasakis, Sadegh Soudjani, Dimos V. Dimarogonas

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract)

AI总结 针对信号时序逻辑下的多主体规划问题,提出基于惩罚函数的无约束松弛和块坐标梯度下降法,实现可扩展的协同规划。

Comments Submitted to L-CSS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04494 2026-06-04 cs.AI 89%

Beyond Prompt-Based Planning: MCP-Native Graph Planning-based Biomedical Agent System

超越基于提示的规划:基于MCP原生图规划的生物医学智能体系统

Zhangtianyi Chen, Florensia Widjaja, Wufei Dai, Xiangjun Zhang, Yuhao Shen, Juexiao Zhou

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);workflow(abstract);分类 cs.AI

AI总结 提出BioManus系统,通过将异构生物信息学工具编译为标准MCP服务器并构建类型化异构图,实现基于图结构的规划,解决工具混淆和上下文效率问题,在BioAgentBench和LAB-Bench上提升执行准确性和工作流有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 88%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 规划决策 :tool use(title,abstract);agentic(title,abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏