BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
智能体神经架构搜索
机构 * Artificial Intelligence Graduate School, Ulsan National Institute of Science and Engineering(人工智能研究生院,乌山科学与工程研究院) ; Department of Computer Science and Engineering, Ulsan National Institute of Science and Engineering(计算机科学与工程系,乌山科学与工程研究院)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 研究探索LLM驱动设计与NAS驱动搜索的分工,提出用LLM生成种子架构并分解为带插槽架构供NAS搜索的机制,在AgentNAS中实例化,在多任务上表现出色,两种搜索机制互补。
工具使用何时会增强有限精度循环模型的表达能力?
机构 * Robotics and Perception Group University of Zurich(机器人感知组苏黎世大学) ; Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) ; Shenzhen Research Institute of Big Data(深圳大数据研究 institute) ; Tengen Intelligence Institute CRRC Zhuzhou Institute(腾云智能研究院 CRRC 长沙研究所)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 研究工具使用对有限精度循环模型表达能力的影响,通过将模型建模为与预言机交互的有限状态控制器,得出有限状态工具基本不增加表达能力,单个无限状态磁带使系统图灵完备,且特定单层控制器可实现此构造的结论。
Comments 24 pages
超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证
机构 * Centific
专题命中 工具调用 :tool-use(title);分类 cs.AI
AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。
OpenReward: 通过强化学习学习奖励长形式智能体任务
机构 * Leiden University(莱顿大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学)
专题命中 工具调用 :agentic(title);分类 cs.CL
AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。
流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化
机构 * SMG Labs(SMG实验室)
专题命中 工具调用 :tool use(title);分类 cs.CL
AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。
通过训练期间回收零方差查询实现智能体搜索的有效强化学习
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID) ; NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 提出查询回收方法,将训练中零方差查询重新投入采样池,使有效训练分布随策略演化,1.7B模型在7个多跳QA基准上平均Pass@1达66.0,匹配或超越7B模型。
Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用
专题命中 工具调用 :agent(title);分类 cs.SE
AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。
观察而非预测:面向智能体服务的对话级解耦调度
机构 * Anonymous Authors(匿名作者)
专题命中 工具调用 :agentic(title);分类 cs.LG
AI总结 提出将调度单元从单轮提升至整个对话,利用对话中首轮计算密集与后续内存密集的两阶段可观察特性,实现无需预测的解耦调度,显著降低延迟并提升能效。
SkillSmith: 技能与工具的协同进化用于自我改进的智能体系统
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东部技术研究所) ; University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Ningbo Institute of Digital Twin(宁波数字孪生研究所)
专题命中 工具调用 :agent(title);分类 cs.AI
AI总结 提出SkillSmith框架,通过统一提案空间和Lotka-Volterra生态效用模型实现技能与工具的协同进化,在多个基准测试中显著提升性能。
PiCA:基于枢纽的搜索代理强化学习中的信用分配
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 工具调用 :agentic(title);分类 cs.AI
AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。
Comments 21 pages, 7 figures
DADL:用于LLM代理系统企业工具库的声明性描述语言
专题命中 工具调用 :agent(title);分类 cs.SE
AI总结 DADL通过单一声明性文件描述REST API的端点、认证、分页等,实现企业工具库的集中管理和高效调用,显著降低上下文窗口消耗。
Comments 14 pages, 1 figure. Also published on Zenodo: https://doi.org/10.5281/zenodo.19931788
Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集
机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)
专题命中 工具调用 :tool use(title);分类 cs.LG
AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。
MCP与RAG与NLWeb与HTML:不同网页代理接口的有效性和效率比较(技术报告)
机构 * Data and Web Science Group(数据与网络科学组) ; University of Mannheim(曼海姆大学)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文比较了四种网页代理接口的有效性和效率,发现RAG、MCP和NLWeb在效果和效率上均优于HTML。
Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13-17, 2026, Dubai, United Arab Emirates. ACM, New York, NY, USA, pp. 8493-8496
循环一致性搜索:问题可重构性作为搜索代理训练的代理奖励
机构 * Meta Superintelligence Labs(Meta超智能实验室)
专题命中 工具调用 :agent(title);分类 cs.AI
AI总结 本文提出Cycle-Consistent Search框架,通过问题可重构性作为奖励信号,无需黄金监督训练搜索代理,在信息检索任务中实现与监督基线相当的性能。
利用AI代理的网络搜索工具进行数据外泄
机构 * Open Hippo GmbH(Open Hippo有限公司) ; University of Augsburg(奥格斯堡大学) ; Smart Labs AI GmbH(Smart Labs AI有限公司)
专题命中 工具调用 :AI agent(title);分类 cs.CL
AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。
Comments 9 pages, 6 figures, conference article
隐式庞加莱形变用于代理强化学习
专题命中 工具调用 :agentic(title);分类 cs.LG
AI总结 LaPha通过在庞加莱潜在空间中引入隐式形变,提升LLM代理在数学任务中的性能,实现自我引导的测试时间扩展和更高的准确率。
如何训练你的深度研究代理?搜索-R1中的提示、奖励和策略优化
机构 * CASIA(中国科学院自动化研究所) ; NLPR & MAIS(自然语言处理与人工智能研究室) ; School of AI UCAS(中国科学院大学人工智能学院) ; Meituan Inc(美团公司)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文提出通过优化提示模板、奖励函数和策略优化方法来提升深度研究代理的性能,通过实验发现快速思考模板和REINFORCE在性能和稳定性上表现更优,同时引入Search-R1++基线提升了Search-R1的性能。
SIGHT: 基于自证证据和信息增益多样分支的强化学习
机构 * Zhejiang University(浙江大学) ; Chongqing Ant Consumer Finance Co., Ltd.(重庆蚂蚁消费金融有限公司) ; Alibaba Group(阿里巴巴集团)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 SIGHT通过自证证据和信息增益驱动多样化分支,提升搜索代理的自主推理能力,减少冗余并增强探索策略。
聚合物代理:用于聚合物设计的大型语言模型代理
机构 * Department of Materials Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) ; Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文提出基于LLM的聚合物代理,通过结构-性质预测和生成技术,助力实验室研究人员高效发现新型聚合物结构。
关于代理搜索中群体相对策略优化崩溃:懒惰似然位移
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Meta AI
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文提出LLDS正则化方法,解决GRPO在代理搜索中因LLD导致的训练崩溃问题,提升模型性能达45.2%。
一个开放且可重复的深度研究代理用于长格式问答
机构 * Studio Ousia(Ousia工作室) ; Tohoku University(东京大学) ; DENTSU SOKEN INC.(DENTSU SOKEN公司) ; RIKEN(日本学术振兴会) ; NII LLMC(日本信息处理学会LLMC)
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。
Comments Technical report of a winning system in the NeurIPS MMU-RAG competition
RESTifAI:基于大语言模型的可重用REST API测试工作流
专题命中 工具调用 :workflow(title);分类 cs.SE
AI总结 RESTifAI是一种基于大语言模型的工具,用于生成可重用且适用于CI/CD的REST API测试,通过系统性构建测试场景并验证功能和鲁棒性。
Comments Accepted for ICSE 2026 Demonstration track
机构 * School of Computer Science, Fudan University(复旦大学计算机学院)
专题命中 工具调用 :agentic(title);分类 cs.CL
机构 * Amazon(亚马逊)
专题命中 工具调用 :tool-use(title);分类 cs.AI
机构 * Google Cloud(谷歌云) ; KAIST(韩国科学技术院)
专题命中 工具调用 :agent(title);分类 cs.LG
机构 * Production R\&D, Tencent Amsterdam, Netherlands
专题命中 工具调用 :agent(title);分类 cs.AI
Journal ref 2024 IEEE Conference on Games (CoG), Milan, Italy, 2024, pp. 1-4
专题命中 工具调用 :function calling(title);分类 cs.SE
机构 * State Key Laboratory of CCSE,School of Computer Science and Engineering,Beihang University(信息与通信系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Institute of Technology(北京理工大学)
专题命中 工具调用 :agent(title);分类 cs.CL
专题命中 工具调用 :agentic(title);分类 cs.AI
Comments 10 pages, 5 figures