KBQA-o1: Agentic Knowledge Base Question Answering with Monte Carlo Tree Search
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
Comments Accepted by ICML 2025 main conference
Journal ref ICML 2025
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL
Comments Accepted by ICML 2025 main conference
Journal ref ICML 2025
专题命中 工具调用 :agent(title);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
专题命中 工具调用 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.CL
Comments Accepted to the 2025 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL) - System Demonstration Track
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.CL
专题命中 工具调用 :tool-use(title,abstract);function calling(abstract);分类 cs.AI、cs.CL
Comments 8 pages
专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments Preprint
专题命中 工具调用 :planning(title);tool-use(abstract);function calling(abstract);分类 cs.AI、cs.SE
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.LG
专题命中 工具调用 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG
专题命中 工具调用 :tool use(title,abstract);planning(abstract);分类 cs.AI、cs.LG
Comments 19 pages, 14 figures, 2 tables
机构 * Peking University(北京大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of Arizona(亚利桑那大学)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI
Comments ACL 2025 main. The code can be found at https://github.com/Arvid-pku/Godel_Agent
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool use(abstract);tool-use(abstract)
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
MCPZoo:大规模可运行模型上下文协议服务器数据集用于AI代理
专题命中 工具调用 :agent(title);AI agent(title)
AI总结 MCPZoo是一个大规模可运行模型上下文协议服务器数据集,用于支持AI代理与外部工具交互的实证研究和安全分析
专题命中 工具调用 :agent(title);multi-agent(title)
专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);multi-agent(abstract)
专题命中 工具调用 :agent(title);multi-agent(title)
专题命中 工具调用 :agent(title);multi-agent(title)
当你的智能体打开聊天应用时:智能体控制的原始聊天日志搜索可与结构化记忆相媲美
机构 * University of Science and Technology of China(中国科学技术大学) ; MetaStone Technology(MetaStone科技公司)
专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.CL
AI总结 该研究提出无语义结构的智能体控制搜索界面ReFind,在MemoryAgentBench等任务上,其检索准确率优于HippoRAG 2等结构化记忆系统,证明可控词汇检索可替代复杂记忆结构实现高效会话记忆任务。
AI时代的营养数据基础设施:为智能体介导的研究实现FAIR原则
专题命中 工具调用 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 该研究针对AI智能体介导营养研究的数据歧义问题,提出NDS基础设施,实现FAIR原则,在基准测试中表现优于现有模型,保障分析可复现,为相关研究提供新型数据支撑。
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
基于代理的贝叶斯优化:通过代理增强的自动研究
机构 * Meta ; RWTH Aachen University(亚琛工业大学)
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。
FlowScout:从执行反馈到可靠的工具使用智能体工作流
专题命中 工具调用 :agent(title);workflow(abstract);agentic(abstract);分类 cs.LG
AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。
智能体阶段一仿星器优化:有限β平衡的自主多目标搜索
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出智能体阶段一仿星器优化概念,通过语言模型智能体与DESC执行配合,提升有限β平衡构型的质量与数量,生成结构化决策数据,实现可扩展的多目标优化。
智能体AI:用户赋能还是圈地?
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 本文通过分析广告拦截器等四个领域,指出智能体AI的治理决策本质是政治选择,其配置正被模型上下文协议等专有框架锁定,可能损害用户权益。
Comments Extended version of AIES'2026 publication
视觉工具使用的错觉:对图像思考的因果审查
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。
CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。
对现代LLM代理框架中缺陷的实证研究
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。
Lean Refactor: 通过代理策略搜索实现多目标可控的证明优化
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Amazon Web Services(亚马逊网络服务) ; MiroMind ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Lean Refactor框架,通过检索增强的代理策略搜索,解决多目标、可控和版本鲁棒的Lean证明重构问题,主要贡献是通过预注释的多目标重构策略数据库实现高效的证明优化。
聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。