The Bitter Lesson of Tool Calling
工具调用的惨痛教训
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.CL
AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
工具调用的惨痛教训
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.CL
AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。
Magnet:通过能力累积检测跨会话的AI滥用
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。
SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。
LeanCSP:Lean中用于验证约束重构与求解的框架
机构 * TU Wien(维也纳技术大学)
专题命中 工具调用 :planning(abstract);workflow(abstract);分类 cs.AI
AI总结 本研究在Lean定理证明器中提出LeanCSP框架,可验证约束重构的语义正确性与求解器结果,其已验证对称性破缺能大幅减少求解搜索工作量,且Lean内认证成本可承受。
深度搜索中的委托智能:一种用于解缠能力诊断的可控框架
机构 * UCAS(中国科学院大学) ; Renmin University of China(中国人民大学)
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 研究深度搜索中委托智能,将其分解为搜索决策和信息合成与验证维度。通过开发可控合成管道构建DelegSearchBench及评估协议,实验证明仅用最终答案准确性不能充分表征深度搜索能力。
Comments Work in Progress
ARdena:实时大语言模型智能体的场景驱动控制
机构 * Faculty of Applied Mathematics and Informatics, University of Osijek Croatia(奥西耶克大学应用数学与信息学院,克罗地亚) ; Meet Intelligent Innovations LLC(Meet智能创新有限责任公司)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究如何在实时交互环境中控制大语言模型智能体行为,提出分层场景驱动的LLM控制框架,通过结构化提示实现运行时行为控制,在ARDena中实现该框架并评估,结果显示场景驱动提示能有效控制LLM智能体。
Comments 12 pages, 3 figures
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体
机构 * Southeast University(东南大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 工具调用 :tool use(abstract);workflow(abstract);分类 cs.AI
AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。
MathCoPilot:一种用于数学研究的人机共生范式的交互式系统
机构 * University of Science and Technology of China(中国科学技术大学) ; School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院)
专题命中 工具调用 :AI agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究提出MathCoPilot这人机共生的数学研究系统,统一三项核心能力。通过它在特定子集和定理上比较四个大语言模型,发现当前模型处理本科问题成功率高,但在特定领域定理上仍面临挑战。
软件供应链已死:面向用例的再生
专题命中 工具调用 :workflow(abstract);agentic(abstract);分类 cs.SE
AI总结 研究现代软件开发中构建与复用权衡因软件供应链攻击及生成式人工智能而改变,提出面向用例的再生范式,评估智能工作流程,通过对180个存储库-依赖对测量,证明该方法可行,推动软件采购向可验证的特定于存储库的代码合成发展。
Comments [ESEM'26-ERVR] Proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026 Emerging Results, Vision, and Reflection Papers)
UMoE:在特定领域训练中解锁每个专家
机构 * Qwen Team(通义千问团队) ; DeepSeek-AI(渊亭科技) ; Thinking Machines Lab(思维机器实验室) ; LLM-Core Xiaomi(小米大语言模型核心团队)
专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL
AI总结 研究针对特定领域训练中专家池不合理问题,提出UMoE流程,先修剪低显著性专家,再扩展专家池,最后应用标准SFT,该方法在多架构、多领域及多基准测试中优于直接SFT,能转化冗余容量,提升训练效果。
限制非确定性:作为数据库管理系统的人工智能驱动研究系统,实现可靠、无浪费、透明和协作式研究 [愿景]
机构 * EPFL(瑞士联邦理工学院)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究指出大语言模型代理在研究中存在不可信问题,根源是代理循环的随机调用无法检查内部状态。借鉴数据库经验,建议用确定性带版本的数据流引擎组织研究项目,大语言模型作查询编译器,五条设计规则确保研究可靠、透明且协作。
临时权限,永久影响:大型语言模型代理的提交时间授权
机构 * International University of La Rioja(拉里奥ja国际大学)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究大型语言模型代理提交时间授权问题,构建受控失效套件实验,发现端点成功率高但授权完成率低,评估缓解措施,提出CommitGuard可阻止过时持久影响尝试,指出端点成功是实用指标,授权提交是安全属性。
Comments 20 pages
想得大,搜得小:分层搜索智能体中容量的关键所在?
机构 * School of Data Science and Engineering(数据科学与工程学院)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 研究基于大语言模型的分层搜索智能体中模型容量分配问题,通过角色分解和受控容量扫描实验,发现容量敏感性不对称,分解是瓶颈,还给出了集中容量于委托、缩减执行容量且不牺牲精度的构建分层搜索智能体方法。
Comments 21pages
战略性购买智能体
机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究面向自主代客购物场景,分三类信息场景设计有限购物窗口内的最优购买策略,经真实电商价格数据验证,大模型更适配场景选择而非直接购买决策。
CONTRA:可个性化代理的红队配置
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件研究所)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 探讨代理配置与执行危险行为风险的关系,提出CONTRA算法,通过推理评估良性但危险的配置发现导致恶意行为的代理配置,构建数据集分析发现多数技能有恶意配置,CONTRA能成功识别部分危险配置。
大规模安全测试LLM智能体:从风险发现到基于证据的验证
机构 * AntGroup(蚂蚁集团) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Hunan Institute of Advanced Technology(湖南先进技术研究院) ; Deakin University(迪肯大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。
AutoRestTest 在 SBFT 2026 工具竞赛中
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 提出结合语义属性依赖图、多智能体强化学习和大型语言模型的AutoRestTest方法,在SBFT 2026 REST联赛中11个API上三项评估均获第一。
Comments 2 pages, 1 figure. Published in the 19th Search-Based and Fuzz Testing Workshop (SBFT '26), co-located with ICSE 2026
Journal ref Proceedings of the 19th Search-Based and Fuzz Testing Workshop (SBFT '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 2026
ToolPrivacyBench: 对使用工具的LLM代理进行目的绑定隐私基准测试
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 针对现有评估忽略多工具轨迹中目的绑定信息流的问题,提出ToolPrivacyBench基准,通过策略知识库审计工具参数和后端日志,评估任务完成与隐私过度披露,发现成功执行任务可能伴随不必要的隐私泄露。
Comments 24 pages, 7 figures, 15 tables
ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答
机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) ; The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。
闭环发现心理学理论:自动化认知科学家
专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出AutoCog系统,利用大语言模型代理自动生成、测试和优化认知理论,在决策领域发现并验证了新理论。
Comments 44 pages, 9 figures
工具增强的LLM智能体在真实世界能源分析任务中的表现如何?
机构 * Independent Researcher(独立研究员) ; Tume AI
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 针对能源领域缺乏智能体评估基准的问题,构建了包含243个专家策划问题的测试环境,评估工具增强的LLM智能体在数据检索、知识解释和定量建模三类任务上的表现。
GIF: 局部几何信息流控制用于大语言模型
机构 * Columbia University(哥伦比亚大学)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI
AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。
PulseCX:打破实时客户体验中的封闭世界假设
机构 * Sprinklr AI, Gurugram, India(Sprinklr AI,古尔冈,印度)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 提出PulseCX框架,通过解耦知识获取与消费,采用异步代理和衰减感知时序知识图谱(DA-TKG)管理信息生命周期,结合分层意图门控消除同步搜索瓶颈,在动态环境中提升意图解析率和客户满意度。
基于AI的自适应水网管理框架及概念验证实施:解决约旦无收益水问题
机构 * Jordan(约旦)
专题命中 工具调用 :AI agent(abstract);function calling(abstract);分类 cs.AI
AI总结 提出集成EPANET水力建模、数字孪生、SCADA和LLM智能体的框架,通过实时数据与物理模拟结合实现异常检测与自适应决策,概念验证在约旦1164节点管网中实现2分钟内自动生成健康报告,爆管检测定位准确。
Journal ref 2026 2nd International Conference on Computational Intelligence Approaches and Applications (ICCIAA)
面向人类、智能体和工具化的规范
专题命中 工具调用 :AI agent(abstract);agentic(abstract);分类 cs.SE
AI总结 提出 Bosque API (BAPI) 生态系统,通过高表达力的规范语言支持全生命周期开发,解决智能体 AI 系统的安全与编码挑战。
CacheRL: 通过缓存轨迹和混合奖励实现多轮工具调用智能体
机构 * Center for Advanced AI Accenture(埃森哲高级人工智能中心)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出CacheRL系统,通过混合思维轨迹流水线、三级模糊缓存和缓存层级感知奖励,以100倍更少计算量实现92%的多步工具调用准确率,接近GPT-5的94%。
我能买你的KV缓存吗?
机构 * Harbin Institute of Technology, Shenzhen (HITSZ)(哈尔滨工业大学(深圳))
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 针对AI代理重复计算相同文档KV缓存的问题,提出由发布者预计算KV缓存,其他代理付费加载以跳过预填充,实验表明在Qwen3-4B上计算成本降低9-50倍,并设计了代理原生预填充CDN架构。
PI-Hunter:用于暴露和定位提示注入的自动化红队测试
机构 * Google Cloud AI Research(谷歌云人工智能研究) ; Google(谷歌) ; Michigan State University(密歇根州立大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。
当更多文档损害RAG:利用领域限定、模型无关的检索缓解向量搜索稀释
机构 * Dept. of Electrical Engineering & Computer Science, University of Wyoming(怀俄明大学电气工程与计算机科学系) ; Dept. of Civil, Architectural Engineering & Construction Management, University of Wyoming(怀俄明大学土木、建筑工程与施工管理系)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 针对检索增强生成在异构文档集合中因向量搜索稀释导致性能下降的问题,提出基于组织元数据的领域限定方法MASDR-RAG,显著提升P@10至0.86,并揭示多智能体编排的精度-忠实度悖论。
Comments 24 pages, 8 figures, 30 tables. Preprint under review