arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 92539 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2607.26497 2026-08-03 cs.CL 版本更新 84%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 工具调用 :agent(summary_cn,abstract);agentic(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI 84%

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

专题命中 工具调用 :tool use(title);agentic(title);分类 cs.AI

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18850 2026-05-20 cs.IR cs.AI 84%

KadiAssistant: A conversational AI Agent for information retrieval in Kadi4Mat

KadiAssistant: 一种用于Kadi4Mat研究数据生态中信息检索的对话式AI代理

Adrian Cierpka, Mohammad Shafiqul Islam, Johannes Steinhülb, Eric Dietriche Sesso Domtchoueng, Michael Selzer, Arnd Koeppe

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 工具调用 :agent(title);AI agent(title);分类 cs.AI

AI总结 本文提出KadiAssistant,一种集成了隐私设计的AI助手,旨在帮助研究人员高效访问、聚合和整合异构且敏感的研究数据,通过结合自托管的大语言模型和隐私保护的语义搜索,提升信息检索效率并满足复杂的访问控制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29656 2026-04-01 cs.NI cs.AI 84%

6GAgentGym: Tool Use, Data Synthesis, and Agentic Learning for Network Management

6GAgentGym:网络管理中的工具使用、数据合成与代理学习

Jiao Chen, Jianhua Tang, Xiaotong Yang, Zuohong Lv

机构 * Shenzhen Smart City Technology Development Group Company, Ltd.(深圳市智慧城市科技发展集团有限公司) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) China Unicom Group Co., Ltd.(中国联合网络通信集团有限公司)

专题命中 工具调用 :tool use(title);agentic(title);分类 cs.AI

AI总结 本文提出6GAgentGym框架,通过闭环交互实现网络管理中的工具使用与学习,结合NS-3仿真数据和自学习模型,使开源模型在6GAgentBench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18096 2025-09-04 cs.AI 84%

Deep Research Agents: A Systematic Examination And Roadmap

Yuxuan Huang, Yihang Chen, Haozheng Zhang, Kang Li, Huichi Zhou, Meng Fang, Linyi Yang, Xiaoguang Li, Lifeng Shang, Songcen Xu, Jianye Hao, Kun Shao, Jun Wang

机构 * Deep Research Agents(深度研究代理)

专题命中 工具调用 :agent(abstract);tool use(abstract);tool-use(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06272 2025-04-10 cs.IR cs.AI 84%

RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections

Kevin Dela Rosa

专题命中 工具调用 :agentic(title);agent(abstract,comments);AI agent(abstract,comments);分类 cs.AI

Comments Presented at AI Agent for Information Retrieval: Generating and Ranking (Agent4IR) @ AAAI 2025 [https://sites.google.com/view/ai4ir/aaai-2025]

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 84%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10042 2026-08-12 cs.LG cs.AI 新提交 84%

UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

UserToolBench:用于工具使用类大语言模型个性化决策的用户画像隐藏型基准测试集

Xuexiong Yin, Zechuan Chen, Yongsen Zheng, Yuxiang Zhang, Jingyuan Yang, Bin Wang, Yubin Wang, Keze Wang

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 UserToolBench是针对工具使用类大语言模型的基准测试集,可评估模型从交互历史推断用户偏好等个性化决策能力,实验发现当前模型在多工具协调等方面仍存瓶颈。

Comments 21pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08557 2026-08-12 cs.CL cs.CV cs.LG 版本更新 84%

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案

Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02411 2026-08-11 cs.AI cs.IR cs.LG cs.MA 版本更新 84%

FitText: Evolving Agent Tool Ecologies via Memetic Retrieval

FitText: 通过模因检索演化智能体工具生态

Kyle Zheng, Han Zhang, Renliang Sun, Chenchen Ye, Wei Wang

机构 * UCLA(加州大学洛杉矶分校)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 针对用户任务描述与工具文档间的语义鸿沟,提出FitText框架,将检索嵌入推理循环,通过自然语言伪工具描述迭代优化和模因进化选择,显著提升工具检索性能。

Comments 30 pages, including appendices. Accepted at COLM 2026 (main conference) and the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 84%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 84%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07379 2026-07-09 cs.AI cs.LG 新提交 84%

Physics-Audited Agentic Discovery in Scientific Machine Learning

科学机器学习中的物理审核智能发现

Diab W. Abueidda, Bilal Ahmed, Panos Pantidis, Mostafa E. Mobasher

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) National Center for Supercomputing Applications, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算应用中心)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能科学机器学习中替代模型选择问题,提出物理审核智能SciML工作流程,先确定评分评估器,推导物理要求并检查候选者输出,搜索违规情况。通过数值示例验证,该方法能选到满足物理条件的替代模型,区别于仅靠综合分数的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 84%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 工具调用 :AI agent(title);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03441 2026-07-07 cs.LG cs.AI 新提交 84%

No Time Like the Present: Agentic Test-Time Training for LLM Agents

机不可失:大语言模型智能体的测试时训练

Yanbo Wang, Jinhua Hao, Yuze Shi, Kun Yuan, Ming Sun

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究多轮智能体情节中的连续测试时训练,提出智能体测试时训练方法,通过token级重加权减少重复文本损失,构建并发服务系统,提升了在ALFWorld和SWE-bench Lite上的成功率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14192 2026-07-07 cs.AI cs.CL 版本更新 84%

Toward Efficient Agents: Memory, Tool learning, and Planning

迈向高效智能体:记忆、工具学习与规划

Xiaofang Yang, Lijun Li, Heng Zhou, Tong Zhu, Xiaoye Qu, Yuchen Fan, Qianshan Wei, Rui Ye, Li Kang, Yiran Qin, Daizong Liu, Qi Li, Ning Ding, Siheng Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 工具调用 :planning(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。

Comments 63 pages, 244 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26474 2026-06-26 cs.LG cs.AI 新提交 84%

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

将RL诱导的工具使用定位到单个交叉编码器特征

Andrii Shportko, Shubham Bhokare, Ahmed Zeyad A Alzahrani, Bowen Cheng, Gustavo Mercier, Jessica Hullman

专题命中 工具调用 :tool use(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出专用特征交叉编码器(DFC)隔离强化学习引入的紧凑特征集,通过编码-解码重建提升工具调用正确率31.1个百分点,并实现能力溢出至冻结基模型。

Comments Accepted as a spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 84%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10913 2026-06-25 cs.AI cs.PL cs.SE 版本更新 84%

Shepherd: Enabling Programmable Meta-Agents via Reversible Agentic Execution Traces

Shepherd: 一个为元代理提供形式化执行迹的运行时基座

Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。

Comments 50 pages, 22 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18401 2026-06-16 cs.CL cs.AI 版本更新 84%

SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution

SkillsVote: 代理技能的生命周期治理从收集、推荐到进化

Hongyi Liu, Haoyan Yang, Tao Jiang, Bo Tang, Feiyu Xiong, Yuyu Luo, Zhiyu Li

机构 * Harbin Institute of Technology(哈尔滨理工大学) Soochow University(苏州大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SkillsVote框架,通过生命周期治理管理代理技能,从收集和推荐到进化,提升模型在终端基准和SWE-Bench Pro上的性能。

Comments 71 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11543 2026-06-11 cs.AI cs.SE 新提交 84%

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

SkillJuror:衡量智能体技能组织如何改变运行时行为

Zhiyu Chen, Zihan Guo, Bo Huang, Bingwei Lu, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出SkillJuror框架,通过渐进式披露与扁平基线对比,发现技能组织方式改变智能体搜索和应用程序知识的行为,并在82个任务中提升4.1%的验证通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09138 2026-06-09 cs.LG cs.CL 新提交 84%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00183 2026-06-02 cs.LG cs.AI math.OC stat.ML 84%

Agentic Transformers Provably Learn to Search via Reinforcement Learning

智能体Transformer通过强化学习可证明地学会搜索

Tong Yang, Yu Huang, Yingbin Liang, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) The Ohio State University(俄亥俄州立大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建双头Transformer实现随机深度优先搜索,并分析策略梯度训练动力学,证明该搜索机制能从稀疏强化反馈中分阶段涌现,且具备深度泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03109 2026-05-29 cs.LG cs.AI stat.AP stat.ML 84%

E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing

E-valuator: 基于序贯假设检验的可靠智能体验证器

Shuvom Sadhuka, Drew Prinster, Clara Fannjiang, Gabriele Scalia, Bonnie Berger, Aviv Regev, Hanchen Wang

机构 * Genentech(基因泰克) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学) Stanford(斯坦福大学)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出E-valuator方法,将任意黑盒验证器分数转化为具有可控虚警率的决策规则,通过序贯假设检验实现对智能体轨迹的在线监控,提升统计功效并节省令牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 84%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25920 2026-05-26 cs.CL cs.AI 84%

Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning

LLM 能时间旅行吗?通过强化学习增强法律智能搜索中的时间一致性

Wei Fan, Yining Zhou, Mufan Zhang, Yanbing Weng, Yiran HU, Tianshi Zheng, Baixuan Xu, Chunyang Li, Jianhui Yang, Haoran Li, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) School of Law, Tsinghua University, Beijing, China(清华大学法学院) Cheriton School of Computer Science, University of Waterloo, Waterloo, Canada(滑铁卢大学丘成桐计算机科学系)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出 LegalSearch-R1 框架,结合本地 statute RAG 和在线搜索,通过强化学习在跨修订期数据上训练,以解决法律 LLM 的时间偏差和搜索代理缺乏时间约束的问题,在13项法律任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03790 2026-05-26 cs.CL cs.AI 84%

NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning

NeoAMT: 基于强化学习的新词感知智能机器翻译

Zhongtao Miao, Kaiyan Zhao, Masaaki Nagata, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) NTT Communication Science Laboratories, NTT, Inc.(NTT通信科学实验室,NTT公司)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出NeoAMT框架,利用基于Wiktionary的搜索工具和强化学习训练翻译智能体,以提升包含新词的源句翻译质量。

Comments ACL 2026 Main. Fixed minor typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00933 2026-05-21 cs.SE cs.AI 84%

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器

Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo, Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park, Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler, Bing Liu

机构 * National University of Singapore(新加坡国立大学) Scale AI

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。

Comments 25 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17072 2026-05-19 cs.AI cs.CL 84%

RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation

RAGA:用于自主知识图谱构建和检索增强生成的阅读与图构建代理

Chengrui Han, Zesheng Cheng

机构 * Qingdao University(青岛大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出RAGA框架,通过结合阅读、搜索、验证和构建的认知约束,提升知识图谱构建与检索增强生成的效率和准确性,实现了知识图谱的全生命周期管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI 84%

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏