arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-29 至 2026-04-29 共收录 6 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 6 篇

2602.11224 2026-04-29 cs.SE cs.CL 91%

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

Agent-Diff:通过代码执行基于状态差的评估来基准测试LLM代理在企业API任务上的表现

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

机构 * Minerva University(Minerva大学)

专题命中 工具调用 :agent(title,title_cn);agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出Agent-Diff框架,通过代码执行和基于状态差的评估,评估LLM代理在企业API任务中的性能,提供了九个LLM在224个任务上的基准测试,并通过消融实验评估框架的鲁棒性。

Comments Pre-Print. Under review for KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25012 2026-04-29 cs.LG 88%

Why Search When You Can Transfer? Amortized Agentic Workflow Design from Structural Priors

为何需要搜索?从结构先验出发的 amortized 智能工作流设计

Shiyi Du, Jiayuan Liu, Weihua Du, Yue Huang, Jiayi Li, Yingtao Luo, Xiangliang Zhang, Vincent Conitzer, Carl Kingsford

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(合作人工智能基础实验室) University of Notre Dame(圣约翰大学)

专题命中 工具调用 :workflow(title,abstract);agentic(title,abstract);分类 cs.LG

AI总结 本文提出SWIFT框架,通过结构先验和跨任务工作流演示,实现工作流设计的 amortization,减少计算成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25555 2026-04-29 cs.CR cs.AI 85%

From CRUD to Autonomous Agents: Formal Validation and Zero-Trust Security for Semantic Gateways in AI-Native Enterprise Systems

从CRUD到自主代理:面向AI原生企业系统的语义网关的正式验证与零信任安全

Ignacio Peyrano

机构 * Universidad Austral(乌尔苏拉大学)

专题命中 工具调用 :autonomous agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型上下文协议的语义网关,通过正式验证和实证评估,解决了AI原生系统中自主代理的安全验证问题,采用零信任安全模型和语义模糊化技术,实现了对动态状态转换系统的安全审计。

Comments 25 pages, 4 figures, 4 tables. Open-source proof-of-concept (47 automated tests, deterministic semantic fuzzer) available at https://github.com/PeyranoDev/semantic-gateway-poc

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25846 2026-04-29 cs.CR cs.AI 83%

Towards Agentic Investigation of Security Alerts

朝向安全警报的代理调查

Even Eilertsen, Vasileios Mavroeidis, Gudmund Grov

机构 * University of Oslo(奥斯陆大学) Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI))

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型自动化安全警报初步调查的代理工作流,通过预定义查询和结构化工具访问提高准确性,减少人工工作量。

Comments 10 pages, 3 figures, 4 tables. Accepted at the 2025 IEEE International Conference on Big Data (BigData)

Journal ref Proc. 2025 IEEE Int. Conf. on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 78%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 工具调用 :tool-use(title,abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 74%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 工具调用 :tool use(title);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏