arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-29 至 2026-05-29 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 15 篇

2602.00994 2026-05-29 cs.AI 90%

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

专题命中 工具调用 :tool-use(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-05-29 cs.AI 85%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 工具调用 :function calling(title);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03109 2026-05-29 cs.LG cs.AI stat.AP stat.ML 84%

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

E-valuator: 基于序贯假设检验的可靠智能体验证器

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang

机构 * Genentech(基因泰克) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学) Stanford(斯坦福大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29697 2026-05-29 cs.AI 79%

Beyond Trajectory Rewards: Step-level Credit Assignment for Agentic Search via Graph Modeling

超越轨迹奖励:通过图建模实现智能搜索的步骤级信用分配

Yuchen Liu, Yingjie Feng, Lixiong Qin, Jiasi Chen, Jianing Yu, Sheng Gao, Sheng Yang, Weiran Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc.(李自动公司)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对智能搜索中轨迹级奖励无法量化单步行为贡献的问题,提出基于图距离贡献奖励(GDCR)的步骤级过程奖励,并结合步骤优势策略优化(SAPO)在四个基准上验证有效性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28914 2026-05-29 cs.CR cs.AI 79%

AIRGuard: Guarding Agent Actions with Runtime Authority Control

AIRGuard:通过运行时权限控制守护智能体行为

Suliu Qin, Haomin Zhuang, Yujun Zhou, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Inria, France(法国国家信息与自动化技术研究所) University of Liverpool(利物浦大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对工具使用语言智能体面临的权限混淆问题,提出运行时守卫AIRGuard,通过动作时授权实现最小权限原则,显著降低攻击成功率并保持良好良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07789 2026-05-29 cs.MA cs.CL cs.SE 73%

ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents

ORACLE-SWE:量化Oracle信息信号对SWE代理的贡献

Kenan Li, Qirui Jin, Liao Zhu, Xiaosong Huang, Yijia Wu, Yikai Zhang, Xin Zhang, Zijian Jin, Yufan Huang, Elsie Nallipogu, Chaoyun Zhang, Yu Kang, Saravan Rajmohan, Qingwei Lin, Wenke Lee, Dongmei Zhang

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL、cs.SE

AI总结 提出Oracle-SWE方法,通过隔离和提取SWE基准测试中的Oracle信息信号,量化每种信号对代理性能的贡献,并评估强语言模型提取的信号对基础代理的性能提升。

Comments Under peer review; 37 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-05-29 cs.CL cs.AI cs.CR 73%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27276 2026-05-29 cs.AI cs.CL 73%

SIA: Self Improving AI with Harness & Weight Updates

SIA: 具有框架与权重更新的自我改进AI

Prannay Hebbar, Yogendra Manawat, Samuel Verboomen, Alesia Ivanova, Selvam Palanimalai, Kunal Bhatia, Vignesh Baskaran

机构 * Hexo Labs(Hexo实验室) University of Oxford(牛津大学)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出SIA框架,通过反馈智能体同时更新任务智能体的框架和权重,在三个领域(中国法律罪名分类、GPU内核优化、单细胞RNA去噪)超越仅迭代框架的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28840 2026-05-29 cs.CL cs.AI cs.SE 67%

How Consistent Are LLM Agents? Measuring Behavioral Reproducibility in Multi-Step Tool-Calling Pipelines

LLM代理的一致性如何?测量多步工具调用流水线中的行为可重复性

Abel Yagubyan

机构 * Independent Researcher(独立研究者)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究多步工具调用LLM代理在重复相同调用时是否选择相同工具、顺序和参数,通过系统实验测量行为一致性,并发现代理存在显著不一致性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 62%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29675 2026-05-29 cs.HC cs.AI cs.IR 57%

From Prompts to Context: An Ontology-Driven Framework for Human-Generative AI Collaboration

从提示到上下文:一种面向人类-生成式AI协作的本体驱动框架

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * Gamaizer Université de technologie de Compiègne, CNRS, Heudiasyc(法国图尔学院、CNRS、Heudiasyc) Sorbonne Université, CNRS UMR 7585, LPMHE(索邦大学、CNRS UMR 7585、LPMHE)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一种基于本体(CCAI)的框架,通过结构化建模任务、角色、资源和约束,将提示-响应交互转化为可查询的协作轨迹,以提升信息密集型工作流中的可追溯性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29270 2026-05-29 cs.AI 57%

Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies

索引不可读之物:基于LLM原生的服务分类法递归构建与搜索

Wei Zheng, Yang Yan, Yiyang Shao, Jinyang Li, Zeze Chang, Yukuang Jia, Qiming Mao, Chihyung Wang, Jingbin Zhou

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对LLM在服务发现中因上下文窗口限制和长输入中间信息丢失问题,提出LLM原生的渐进式披露方案A2X,通过自动构建层次化服务分类法并在查询时逐层遍历,显著提升检索准确率并降低token消耗。

Comments Preprint. 8 pages main paper + appendix; 2 figures. Under submission to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29174 2026-05-29 cs.AI cs.CR 57%

Paper Agents, Paper Gains: An Empirical Analysis of DeFi Investment Agents

Paper Agents, Paper Gains: DeFi投资代理的实证分析

Jay Yu, Amy Zhao, Danning Sui

机构 * Pantera Capital(Pantera资本) Stanford University(斯坦福大学) IC3 Ava Labs(Ava实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 通过分析1900多个AI加密项目、10个代表性代理和11个Solana代理金库,发现当前DeFi投资代理仍处于早期阶段,存在自主执行证据不足、代币持有者集体亏损、估值与基本面脱节等问题,并提出成熟度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13519 2026-05-29 cs.CL 57%

ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding

ToolSpec: 通过模式感知与检索增强的推测解码加速工具调用

Heming Xia, Yongqi Li, Cunxiao Du, Mingbo Song, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Peking University(北京大学)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 针对工具调用延迟问题,提出一种基于模式感知和检索增强的推测解码方法ToolSpec,利用预定义工具模式生成准确草稿,并通过有限状态机交替填充确定性模式令牌和推测生成可变字段,同时检索历史调用复用草稿,实现最高4.2倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29269 2026-05-29 cs.CR 50%

HunterAgent: Neuro-Symbolic Attack Trace Reconstruction under Anti-Forensics

HunterAgent: 反取证下的神经符号攻击痕迹重建

Guangze Zhao, Yongzheng Zhang, Weilin Gai, Hongri Liu, Yuliang Wei, Bailing Wang

专题命中 工具调用 :agentic(abstract)

AI总结 针对反取证技术导致的攻击痕迹断裂问题,提出神经符号框架HunterAgent,将痕迹重建建模为部分可观测下的代价约束启发式图搜索,通过生成器-验证器流水线和校准代价函数实现高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏