WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
专题命中 工具调用 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.CL
Comments AAAI 2025 & ACL 2024 NLRSE, 7 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.CL
Comments AAAI 2025 & ACL 2024 NLRSE, 7 pages
机构 * Boston University(波士顿大学) ; Rutgers University(罗格斯大学) ; AIOS Foundation(AIOS基金会)
专题命中 工具调用 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI
专题命中 工具调用 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 12 Pages, 1 figure
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments Accepted by AAAI 2025. This version contains the appendix
专题命中 工具调用 :agent(abstract);AI agent(abstract);tool-use(abstract);分类 cs.AI
专题命中 工具调用 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments Accepted in ICAPS 2024
专题命中 工具调用 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI
Comments 18 pages, 8 figures, 2 tables
专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.CL
Comments 59 pages, 5 figures
专题命中 工具调用 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.CL
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments This is a preprint of the paper accepted to MICAI 2022
专题命中 工具调用 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.LG
Comments Oral Presentation at NeurIPS 21 Datasets and Benchmarks Track. Project page: http://www.threedworld.org
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments This is a pre-print of the paper accepted to AAAI 2021
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
专题命中 工具调用 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.LG
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 14 pages, 3 figures, Published as IBM Research Report RT0982
专题命中 工具调用 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI
Comments 9 pages, 8 figures
专题命中 工具调用 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI
Comments Appears in Proceedings of the Twenty-First Conference on Uncertainty in Artificial Intelligence (UAI2005)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI
Comments 5 pages, 1 figure; In H. Liu, J. J. Salerno, and M. J. Young, editors, Social Computing, Behavior Modeling, and Prediction, 2009
当较低权限足够时:探究LLM代理中的过度权限工具选择
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 工具调用 :agent(abstract,comments);tool use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。
Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
论智能体工具调用与强化学习训练的有效性与效率
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。
Comments ICML 2026
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
章鱼:用于软件API函数调用的设备端语言模型
机构 * Stanford University(斯坦福大学) ; Harvard University(哈佛大学)
专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE
AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。
SAGA:用于智能文本到SPARQL生成的模式感知基础
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。
DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 工具调用 :planning(title);分类 cs.AI、cs.CL
AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。
Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings
Tool Forge:一种用于受控代理执行的携带验证的工具链
机构 * Next Moca Global, Inc.(Next Moca全球公司)
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.SE
AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。
Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge
FinMCP-Bench:基于模型上下文协议的LLM代理在真实金融工具使用中的基准测试
机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云云计算千问点睛团队) ; YINGMI Wealth Management(盈米财富管理) ; Soochow University(苏州大学)
专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL
AI总结 本文提出FinMCP-Bench,用于评估LLM在解决真实金融问题时通过调用金融模型上下文协议的能力,包含613个样本,涵盖10种主要场景和33种子场景,提供真实和合成查询,评估不同任务复杂度下的模型表现。
Comments Accepted by ICASSP 2026