arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-25 至 2026-06-25 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 15 篇

2606.05872 2026-06-25 cs.AI cs.CV 版本更新 89%

Entropy-Based Observability for AI Agent Behavior

基于熵的AI智能体评估:一种测量行为模式的轻量级框架

Olasimbo Ayodeji Arigbabu

机构 * Olasimbo Ayodeji Arigbabu(奥拉西姆波·阿里加布)

专题命中 工具调用 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 提出一种基于熵的轻量级评估框架(EEA),通过动作熵、轨迹熵、工具熵、信息增益、探索效率和鲁棒性熵等指标,从决策过程结构角度补充传统任务成功率等评估方法。

Comments 6 pages, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26027 2026-06-25 cs.CL cs.LG 新提交 86%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 84%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 84%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25960 2026-06-25 cs.AI 新提交 83%

Agentic System as Compressor: Quantifying System Intelligence in Bits

智能体系统作为压缩器:用比特数衡量系统智能

Zihan Qin, Hongrui Zhang

机构 * Peking University(北京大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25876 2026-06-25 cs.SE cs.CR 新提交 83%

The Web4 Agent Economy: A Large-Scale Empirical Study of the Landscape, Challenges, and Opportunities

Web4 代理经济:景观、挑战与机遇的大规模实证研究

Yuhan Jin, Shuohan Wu, Chong Chen, Lingfeng Bao, Xiaohu Yang, Jiachi Chen

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 通过分析99,448个多链身份注册、3.17亿交易日志、341个MCP项目源码和349个GitHub问题,首次大规模实证研究Web4代理生态,发现自主代理已建立活跃的机器对机器支付经济,但基础设施不成熟,支付互操作性是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29682 2026-06-25 cs.CL 版本更新 83%

Scaling Laws for Agent Harnesses via Effective Feedback Compute

智能体框架的有效反馈计算缩放定律

Xuanliang Zhang, Dingzirui Wang, Keyan Xu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨理工大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.CL

AI总结 提出有效反馈计算(EFC)作为缩放坐标,通过衡量信息性、有效性、非冗余性和保留性来预测智能体框架性能,在多个任务上优于原始计算基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 81%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 工具调用 :function calling(title);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25605 2026-06-25 cs.CL 新提交 77%

Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

开源大语言模型中的约束税:结构化输出约束下工具调用抑制的实证研究

Fangzheng Li, Aimin Zhang, Chen Lv

机构 * Focus AI Center, Focus Technology Co., Ltd.(焦点科技有限公司焦点人工智能中心) Nanjing University of Science and Technology(南京理工大学)

专题命中 工具调用 :agent(abstract,abstract_cn);tool use(abstract);分类 cs.CL

AI总结 本文通过实验发现,在同时启用工具调用和JSON Schema约束时,多个开源模型会抑制工具调用,并提出透明两遍执行策略来恢复工具调用同时保证结构化输出。

Comments 2 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 77%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 工具调用 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25394 2026-06-25 cs.LG cs.AI 新提交 62%

FactorLibrary: From Polynomials to Circuits via Recursive Subgoals

FactorLibrary: 从多项式到电路通过递归子目标

Rohan Pandey, Michael Ruofan Zeng, Weikun K. Zhang, Kaijie Jin, Naomi Morato, Archit Ganapule, Bhaumik Mehta, Jarod Alper

机构 * University of Washington, Seattle, WA, USA(华盛顿大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 将有限域上多项式的最小算术电路发现建模为强化学习问题,提出FactorLibrary存储可分解子表达式作为子目标,使用PPO+MCTS的top-down方法在复杂度8以内达到91.8%的成功率。

Comments 14 pages, 8 figures, in 3rd AI for Math Workshop (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 50%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 工具调用 :workflow(abstract)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25970 2026-06-25 math.OC 新提交 50%

Dominance-Based Feasibility Inference for Packing-Constrained Pickup and Delivery Problems

基于支配性的可行推断用于带装箱约束的取送货问题

Siqiao Li, Mahnam Saeednia, Patrick Stokkink

专题命中 工具调用 :planning(abstract)

AI总结 针对带二维装箱约束的取送货问题,提出一种基于支配性的可行推断框架,通过保序映射和搜索规则减少精确装箱验证调用,将可行性检查时间降低高达42%。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24922 2026-06-25 quant-ph cond-mat.mtrl-sci 交叉投稿 50%

Constraint-Aware Quantum Optimization of Defect Configurations in Doped ZrO2: XY-Mixer QAOA and Grover Adaptive Search

掺杂ZrO2中缺陷构型的约束感知量子优化:XY混合器QAOA与Grover自适应搜索

Huajing Song

专题命中 工具调用 :workflow(abstract)

AI总结 针对掺杂ZrO2热障涂层材料中的成分-缺陷搜索问题,开发了端到端的约束感知量子优化工作流,通过QUBO代理模型和两种量子路径(XY混合器QAOA和容错Grover自适应搜索)实现高效搜索,其中QAOA在深度p=3时将86%的概率质量集中在MACE最优值1 meV内。

Comments 18 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24943 2026-06-25 astro-ph.IM astro-ph.EP physics.soc-ph 新提交 50%

Collaborating with Artists in the Search for Life

与艺术家合作寻找生命

Jack Madden, Cybele Collins, Mia Rollins, Ashika Capirala

专题命中 工具调用 :planning(abstract)

AI总结 本文探讨艺术与科学协作在天体生物学中的价值,通过案例展示艺术家在问题解决、情境化和设计思维方面的独特贡献,并提出资助艺术家咨询、恢复驻留项目等建议。

Comments NASA-DARES 2025 white paper, 5 pages, 3 figures. Originally submitted in 2025 under topic 8 (Prepare for the Discovery of Life Beyond Earth and Subsequent Post-Discovery Activities), which now falls under focus area 9 (Astrobiology in Society)

详情

展开后加载摘要…

URL PDF HTML 收藏