arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 92539 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5014 篇

2605.16598 2026-05-19 cs.MA cs.AI 83%

GRASP: Graph Agentic Search over Propositions for Multi-hop Question Answering

GRASP:基于命题的图代理搜索用于多跳问答

Stockton Jenkins, Ramya Korlakai Vinayak, Junjie Hu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 GRASP通过分解多跳查询为依赖感知计划,实现多跳问答中的高准确率与低token使用。在MuSiQue、2WikiMultihopQA和HotpotQA上,GRASP在开放语料检索和长文本推理设置中均表现优异,且token使用更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02268 2026-05-18 cs.LG 83%

SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization

SKILL0:基于上下文的代理强化学习用于技能内化

Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Chengcheng Han, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 SKILL0通过在训练时逐步减少技能上下文,使模型在无任务检索情况下实现自主行为,实验显示在多个任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI 83%

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26805 2026-05-12 cs.AI cs.MA 83%

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bian Que: 一个具有灵活技能安排的代理框架,用于在线系统运维

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

机构 * Kuaishou Technology(快手科技)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 Bian Que通过统一运维范式和灵活技能安排,提高了在线系统运维效率,减少了警报量,提高了根因分析准确率,缩短了故障解决时间。

Comments HomePage: https://benchen4395.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL 83%

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 83%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 工具调用 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00886 2026-05-11 cs.AI 83%

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 83%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 工具调用 :agentic(title,abstract);tool use(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05460 2026-05-08 cs.AI physics.chem-ph 83%

Agentic Discovery of Exchange-Correlation Density Functionals

代理发现交换关联泛函

Titouan Duston, Jiashu Liang, Yuanheng Wang, Weihao Gao, Xuelan Wen, Nan Sheng, Weiluo Ren, Yang Sun, Yixiao Chen

机构 * Princeton University(普林斯顿大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种基于代理的自动搜索系统,通过迭代计划-执行-总结循环改进泛函性能,发现的SAFS26-a泛函在基准测试中提升了约9%,并强调了领域专业知识对确保科学严谨性的重要性。

Comments 20 pages, 2 figues, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI 83%

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25846 2026-04-29 cs.CR cs.AI 83%

Towards Agentic Investigation of Security Alerts

朝向安全警报的代理调查

Even Eilertsen, Vasileios Mavroeidis, Gudmund Grov

机构 * University of Oslo(奥斯陆大学) Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI))

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种利用大语言模型自动化安全警报初步调查的代理工作流,通过预定义查询和结构化工具访问提高准确性,减少人工工作量。

Comments 10 pages, 3 figures, 4 tables. Accepted at the 2025 IEEE International Conference on Big Data (BigData)

Journal ref Proc. 2025 IEEE Int. Conf. on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21255 2026-04-24 cs.CL 83%

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

当代理看起来相同:量化蒸馏诱导的工具使用行为相似性

Chenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, USTC(USTC计算机科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) M-A-P

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出两种新指标RPS和AGS,用于区分任务成功必需行为与模型自主偏好,通过评估18个模型发现AGS能区分教师特定收敛与通用改进。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12867 2026-04-24 cs.AI 83%

QuarkMedSearch: A Long-Horizon Deep Search Agent for Exploring Medical Intelligence

QuarkMedSearch: 一种长Horizon深度搜索代理用于探索医学智能

Zhichao Lin, Zhichao Liang, Gaoqiang Liu, Meng Xu, Baoyu Xiang, Shuxin Zhao, Yao Wu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group, Alibaba(阿里巴巴文库应用事业部)

专题命中 工具调用 :agent(title);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出QuarkMedSearch,通过构建医疗多跳数据、训练策略和评估基准,提升垂直领域性能。采用两阶段SFT和RL训练策略,结合大规模医疗知识图谱和实时探索生成长Horizon训练数据,实验显示其在开源模型中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06922 2026-04-22 cs.CR cs.LG 83%

Whispers in the Machine: Confidentiality in Agentic Systems

机器中的低语:代理系统中的保密性

Jonathan Evertz, Merlin Chlosta, Lea Schönherr, Thorsten Eisenhofer

机构 * CISPA Helmholtz Center for Information Security(信息安全勒内希特中心)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 研究探讨了基于大语言模型的代理系统中的保密性问题,通过抽象敏感数据为秘密字符串,评估了十种代理在20种工具场景和14种攻击策略下的安全性,发现所有代理均存在至少一种漏洞,现有防御措施无法有效防止数据泄露。

Comments Accepted at Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18356 2026-04-21 cs.CL 83%

ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

ComPASS:通过工具增强的陪伴实现个性化代理社交支持

Zhaopei Huang, Yanfeng Jia, Jiayi Zhao, Xinjie Zhang, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学)

专题命中 工具调用 :agentic(title);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 本文提出ComPASS框架,通过外部工具增强代理能力,构建首个个性化社交支持基准,训练出ComPASS-Qwen模型,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17337 2026-04-21 cs.AI 83%

AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning

AutoSearch: 通过强化学习实现高效的代理RAG自适应搜索深度

Jingbo Sun, Wenyue Chong, Songjun Tu, Qichao Zhang, Yaocheng Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AutoSearch框架,通过强化学习动态调整搜索深度,在保证搜索质量的同时提升效率,实现在复杂问题上的准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 83%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 工具调用 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17052 2026-04-20 cs.LG 83%

Dynamic Tool Dependency Retrieval for Lightweight Function Calling

轻量级函数调用的动态工具依赖检索

Bhrij Patel, Davide Belli, Amir Jalalirad, Maximilian Arnold, Aleksandr Ermolov, Bence Major

机构 * Qualcomm AI Research(高通人工智能研究) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :function calling(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出动态工具依赖检索方法,通过结合初始查询和逐步展开的工具调用计划,提升函数调用的准确性和效率,实验表明其在多个数据集和模型上均优于现有静态检索方法。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23853 2026-04-17 cs.CL 83%

Your LLM Agents are Temporally Blind: The Misalignment Between Tool Use Decisions and Human Time Perception

你的LLM代理是时间盲的:工具使用决策与人类时间感知之间的不一致

Yize Cheng, Arshia Soltani Moakhar, Chenrui Fan, Parsa Hosseini, Kazem Faghih, Zahra Sodagar, Wenxiao Wang, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 工具调用 :tool use(title,abstract);agent(abstract);分类 cs.CL

AI总结 研究揭示LLM代理在动态环境中因时间感知不足导致的工具调用偏差,通过TicToc数据集分析发现现有模型与人类时间感知对齐率低,提出通过后训练对齐提升多轮对话中工具使用与人类时间感知的一致性。

Comments ACL 2026 (findings), Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 83%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05854 2026-04-08 cs.AI 83%

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

深度研究员代理:一个全天候深度学习实验的自主框架,零成本监控

Xiangyue Zhang

机构 * The University of Tokyo(东京大学)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出深度研究员代理框架,实现24/7深度学习实验自动化,通过零成本监控、双层固定大小内存和最小工具集架构,提升实验效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04220 2026-04-07 cs.AI 83%

TimeSeek: Temporal Reliability of Agentic Forecasters

TimeSeek:代理预测者的时序可靠性

Hamza Mostafa, Om Shastri, Dennis Lee

机构 * Automorphic Labs(Automorphic实验室)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 TimeSeek研究代理LLM预测者在预测市场生命周期中的可靠性变化,评估10种前沿模型在150个Kalshi二元市场中的表现,发现早期和高不确定性市场表现最佳,但接近解决和强共识市场时表现下降,网页搜索提升BSS但部分情况下降低,简单两模型组合能减少误差但未超越市场整体。

Comments Workshop paper. 11 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28361 2026-03-31 cs.AI cs.MA 83%

Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science

深度研究的深度研究:从Transformer到代理,从AI到AI为科学

Yipeng Yu

专题命中 工具调用 :agent(title);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨深度研究的定义与发展方向,整合行业深度研究与AI为科学的视角,提出生成式AI的双支柱,并讨论AI4S在各学科的进展及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18866 2026-03-27 cs.AI 83%

Conflict-Based Search for Multi Agent Path Finding with Asynchronous Actions

基于冲突的多智能体路径寻找与异步动作

Xuemian Wu, Shizhe Zhao, Zhongqiang Ren

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于冲突的异步动作搜索方法,解决连续时间冲突基于搜索在异步动作多智能体路径寻找中的不完整性问题,并提高算法的可扩展性。

Comments 9 pages, 10 figures. Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24517 2026-03-26 cs.LG 83%

AVO: Agentic Variation Operators for Autonomous Evolutionary Search

AVO:用于自主进化搜索的代理变异算子

Terry Chen, Zhifan Ye, Bing Xu, Zihao Ye, Timmy Liu, Ali Hassani, Tianqi Chen, Andrew Kerr, Haicheng Wu, Yang Xu, Yu-Jung Chen, Hanfeng Chen, Aditya Kane, Ronny Krashinsky, Ming-Yu Liu, Vinod Grover, Luis Ceze, Roger Bringmann, John Tran, Wei Liu, Fung Xie, Michael Lightstone, Humphrey Shi

机构 * NVIDIA

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 AVO通过自主代理实现变异操作,取代传统进化搜索中的固定突变和交叉操作,展示了在多头注意力中发现超越cuDNN和FlashAttention-4的优化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22367 2026-03-25 cs.IR cs.AI 83%

Reasoner-Executor-Synthesizer: Scalable Agentic Architecture with Static O(1) Context Window

推理-执行-合成器:具有静态O(1)上下文窗口的可扩展代理架构

Ivan Dobrovolskyi

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 工具调用 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出RES架构,通过分离意图解析、确定性数据检索与叙事生成,实现O(1)的token复杂度,有效解决LLM代理中上下文窗口过大导致的幻觉风险和token成本问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21331 2026-03-24 cs.LG cs.PF 83%

AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search

AutoKernel:通过迭代式智能体驱动搜索实现自主GPU内核优化

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 工具调用 :agent(title,abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出AutoKernel框架,通过智能体驱动的迭代搜索优化PyTorch模型的GPU内核,通过自动化测试验证确保性能提升,实测在NVIDIA H100上多个任务中均取得显著性能优势。

Comments 11 pages, 5 tables, 2 figures. Code: https://github.com/RightNow-AI/autokernel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18815 2026-03-20 cs.AI 83%

ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents

ProRL Agent:多轮LLM代理的RL训练rollout-as-a-service

Hao Zhang, Mingjie Liu, Shaokun Zhang, Songyang Han, Jian Hu, Zhenghui Jin, Yuchi Zhang, Shizhe Diao, Ximing Lu, Binfeng Xu, Zhiding Yu, Jan Kautz, Yi Dong

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ProRL Agent,通过API服务提供完整的代理rollout生命周期,支持多样化的代理任务,在无根HPC环境中提供标准化可扩展的沙箱环境,通过软件工程、数学、STEM和编程任务的RL训练验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI 83%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13348 2026-03-17 cs.AI 83%

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展

Yirong Zeng, Xiao Ding, Yufei Liu, Yuxian Wang, Qunyao Du, Yutai Hou, Wu Ning, Haonan Song, Duyu Tang, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) Peking University(北京大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 工具调用 :tool-use(title);AI agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏