arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-21 至 2026-05-21 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 11 篇

2605.21434 2026-05-21 cs.SE 85%

Agentic Model Checking

代理模型检查

Youcheng Sun, Jiawen Liu, Daniel Kroening, Jason Xue

专题命中 工具调用 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20315 2026-05-21 cs.CL 85%

Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

Mix-Quant: 量化预填,精准解码用于代理大语言模型

Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出Mix-Quant,一种简单有效的阶段感知量化框架,用于加速代理大语言模型的推理。通过在预填阶段应用高吞吐量NVFP4量化,同时保留BF16精度用于解码,从而在保持任务性能的同时显著提高效率,实现预填阶段高达3倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00933 2026-05-21 cs.SE cs.AI 84%

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器

Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo, Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park, Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler, Bing Liu

机构 * National University of Singapore(新加坡国立大学) Scale AI

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。

Comments 25 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02660 2026-05-21 cs.AI 83%

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS:模块化代理与反思搜索用于自动化AI研究

Jiefeng Chen, Bhavana Dalvi Mishra, Jaehyun Nam, Rui Meng, Tomas Pfister, Jinsung Yoon

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MARS框架,通过预算感知规划、模块化构建和比较反思记忆解决复杂机器学习工程任务中的执行成本与性能归因问题,实现开放源代码框架在MLE-Bench上的最佳性能。

Comments Paper published at International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17946 2026-05-21 cs.AI cs.CV cs.LG 82%

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain

SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准

Lingtao Mao, Huangyu Dai, Xinyu Sun, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agent(abstract);tool-use(abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20682 2026-05-21 cs.CV 82%

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

IndusAgent: 通过智能工具增强开放词汇工业异常检测

Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Santa Clara University(圣克拉拉大学) LongCat Team(LongCat团队) Independent Researcher(独立研究者) New York University(纽约大学) Sun Yat-sen University(孙中山大学) Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 工具调用 :agentic(title,abstract);agent(abstract)

AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22080 2026-05-21 cs.AI 79%

Sound Agentic Science Requires Adversarial Experiments

声音代理科学需要对抗性实验

Dionizije Fa, Marko Culjak

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16292 2026-05-21 cs.MA cs.SY eess.SY 78%

AMBER: A Columnar Architecture for High-Performance Agent-Based Modeling in Python

AMBER:一种用于Python中高性能基于代理建模的列式架构

Anh-Duy Pham

专题命中 工具调用 :agent(title,abstract)

AI总结 本文提出AMBER,一种基于列式存储的Python框架,通过紧凑的视图API暴露种群操作,以减少解释器开销,从而提高交互式建模、校准和参数扫描的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 62%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 57%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09723 2026-05-21 cs.CL 57%

AI-Assisted Scientific Assessment: A Case Study on Climate Change

AI辅助的科学评估:气候变化案例研究

Christian Buck, Levke Caesar, Michelle Chen Huebscher, Massimiliano Ciaramita, Erich M. Fischer, Zeke Hausfather, Özge Kart Tokmak, Reto Knutti, Markus Leippold, Joseph Ludescher, Katharine J. Mach, Sofia Palazzo Corner, Kasra Rafiezadeh Shahi, Johan Rockström, Joeri Rogelj, Boris Sakschewski

机构 * Potsdam Institute for Climate Impact Research (PIK), Member of the Leibniz Association(波茨坦气候影响研究所(PIK),莱比锡协会成员) Institute for Atmospheric and Climate Science, ETH Zurich(大气与气候科学研究所,苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Miami(迈阿密大学) Centre for Environmental Policy, Imperial College London(伦敦帝国理工学院环境政策中心) Grantham Institute for Climate Change and Environment, Imperial College London(伦敦帝国理工学院气候变化与环境研究所) Energy, Climate and Environment Program, International Institute for Applied Systems Analysis(国际应用系统分析研究所能源、气候与环境项目)

专题命中 工具调用 :workflow(abstract);分类 cs.CL

AI总结 本文探讨了AI在科学评估中的应用,通过与气候科学领域13名科学家的合作,测试了基于Gemini的AI环境在评估大西洋经向翻转环流(AMOC)稳定性方面的效果,展示了AI在加速科学流程和提升报告质量方面的贡献,同时强调了专家补充和监督的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏