Environment-free Synthetic Data Generation for API-Calling Agents
用于 API 调用智能体的无环境合成数据生成
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
用于 API 调用智能体的无环境合成数据生成
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。
给予一寸,他们将索取一英里:理解和测量基于MCP的AI系统中的调用者身份混淆
机构 * Institute for Clarity in Documentation(清晰文档研究所) ; Inria Paris-Rocquencourt(巴黎-罗克Quantin 研究院) ; Rajiv Gandhi University(拉朱·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室) ; Shandong University(山东省大学) ; City University of Hong Kong(香港城市大学)
专题命中 工具调用 :AI agent(abstract);分类 cs.AI
AI总结 研究发现基于MCP的AI系统因缺乏调用者身份验证和细粒度授权而存在安全风险,需改进认证机制以减少攻击面。
Comments Withdrawal due to some flaws in experimental methodology and unresolved ethical issues in data collection. We need to redesign the experiments and obtain proper ethical clearance before resubmission
共享发现悖论:单答案规则如何将更好的信息转化为更差的搜索
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 研究共享信息时单答案规则导致的发现悖论,通过可精确求解的十六盒模型对比不同情况,指出这是协议失败。还探讨了自利搜索者博弈及共同线索模型,贡献是分离信息等因素为精确可复用量的紧凑基准。
Comments 29 pages, 4 figures. Code, data, and an interactive guide: https://github.com/yoheinakajima/shared-discovery-paradox
为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?
机构 * Chapman University(查普曼大学) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。
AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造
机构 * The University of Hong Kong(香港大学)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI
AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。
审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。
Comments 31 pages, 6 figures, 18 tables
结构信息用于重定根莱文树搜索
机构 * Department of Computing Science, University of Alberta, Edmonton, Canada. ; Alberta Machine Intelligence Institute (Amii), Edmonton, Canada. ; Google DeepMind, London, United Kingdom.
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出三种重定根器设计,利用结构信息隐式分解子目标,提升策略树搜索的可扩展性和效率。
Comments ICML 2026
随机重置加速强化学习中的策略收敛
机构 * Biophysics Program, Stanford University(斯坦福大学生物物理项目) ; School of Physics, University of Sydney(悉尼大学物理学院) ; National Institute for Theory and Mathematics in Biology, Northwestern University(生物理论与数学国家研究所,西北大学) ; The University of Chicago(芝加哥大学) ; Princeton-CUNY Center for the Physics of Biological Function, The Graduate Center, CUNY(普林斯顿-纽约大学生物物理功能中心,纽约大学研究生中心)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 研究探讨随机重置与强化学习的交互,发现其能加速策略收敛,通过截断长轨迹提升价值传播,为强化学习提供新的优化机制。
Comments 10 pages, 11 figures
迈向可穿戴健康数据的通用智能与接口
机构 * Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind) ; University of Washington(华盛顿大学) ; University of Oregon(俄勒冈大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出一个基于超过一万亿分钟无标签传感器数据预训练的可穿戴健康基础模型,通过联合扩展模型容量和预训练数据量,在35项健康预测任务上实现系统性性能提升,并利用LLM代理自动搜索下游预测头,集成到个人健康代理中以提高相关性和安全性。
Comments Narayanswamy and Xu are co-first authors. McDuff and Liu are co-last authors
本科早期计算机科学中的一个支架式生成式人工智能实验室:混合方法、多课程评估
机构 * Purdue University(普渡大学)
专题命中 工具调用 :tool use(abstract);分类 cs.AI
AI总结 研究在本科早期计算机科学课程中评估 “AI实验室” 这一支架式GenAI素养干预。通过多课程混合方法收集数据,发现其能改变学生对GenAI的态度及使用策略,且不增加评分作业中GenAI的使用量,推动相关三角测量研究。
Comments 18 pages, 3 figures, 18 tables; v2 substantially refined qualitative analysis and discussion
用于自主无人机群搜索和救援的智能三级学习架构
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。
Comments 9 pages
用于具有连续动作的根并行蒙特卡罗树搜索的高斯过程聚合
机构 * Oxford Robotics Institute, Department of Engineering Science, University of Oxford(牛津机器人研究所、工程科学系、牛津大学)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 研究连续动作空间环境中根并行蒙特卡罗树搜索的聚合问题,核心方法是用高斯过程回归获取动作值估计,经6个领域系统评估,该方法优于现有策略且推理时间增加适度。
Comments To appear in the Reinforcement Learning Journal (RLJ) and to be presented at the Third Reinforcement Learning Conference (RLC 2026)
迈向自我进化智能体:一种受人类启发的遗传网络编程自适应探索-利用框架
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 该研究受人类发育模式启发,提出人类启发的遗传网络编程(HGNP)框架,通过新型自适应交叉、变异算子及循环消除机制,动态调节遗传网络编程中探索与利用的平衡,提升了智能体策略性能,且可应用于多种GNP变体。
当安全性遇见可用性:后量子密码学API的实证研究
专题命中 工具调用 :workflow(abstract);分类 cs.SE
AI总结 通过实证评估开发者与后量子密码学API的交互,识别影响可用性的认知因素,并提出改进建议以促进PQC的采用。
Comments Accepted at the NDSS Symposium on Usable Security and Privacy (USEC) 2026
Journal ref Symposium on Usable Security and Privacy (USEC) 2026, San Diego, CA, USA
MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架
机构 * Apple(苹果公司)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。
Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox
同等准确性,不同证据:作为工具使用代理决策表面的搜索 API
专题命中 工具调用 :agent(abstract);分类 cs.CL
AI总结 研究以搜索 API 为决策表面,用冻结的 GPT - 5.4 代理、两个工具及 100 个问题测试不同搜索提供商。发现虽答案准确性相近,但证据经济性不同,还引入新比率,指出提供商选择是检索预算和策略决策,非单纯召回决策。
迈向面向天气和气候数据的科学发现引擎:一种用于基于嵌入探索的可视化分析工作台
机构 * NSF National Center for Atmospheric Research(国家大气研究中心)
专题命中 工具调用 :workflow(abstract);分类 cs.AI
AI总结 本文提出了一种开源可视化分析工作台,用于探索基于嵌入的天气和气候数据,通过链接嵌入实验与源数据、元数据、空间上下文和模型配置,使潜在空间结果可追溯到物理过程,支持科学发现流程。
Comments 7 pages, 5 figures, Preprint
用于自动驾驶的多模态场景相似性搜索
机构 * aiMotive(爱莫提夫)
专题命中 工具调用 :agent(abstract);分类 cs.LG
AI总结 研究自动驾驶场景相似性搜索,提出多模态框架结合视觉与轨迹表示,对比两种基于轨迹的方法与视觉基线,实验表明轨迹表示在运动事件中性能强,视觉嵌入在外观线索丰富时出色,结合二者可提升检索质量。
Lean-QIT:迈向量子信息理论的形式化基础设施
机构 * QudeLeap Research(QudeLeap研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) ; The University of Hong Kong(香港大学)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。
Comments 24+5 pages, 3 figures
分析师如何在高风险犯罪关联中使用人工智能:一项行业研究
专题命中 工具调用 :workflow(abstract);分类 cs.SE
AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。
Comments 12 pages, 6 figures, FSE Industry
用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 工具调用 :tool-use(abstract);分类 cs.LG
AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。
Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986
通过安全感知工具描述减轻MCP服务器中的污点式漏洞
专题命中 工具调用 :autonomous agent(abstract);分类 cs.SE
AI总结 研究MCP服务器污点式漏洞,提出SPELLSMITH,通过分析服务器高风险能力,结合工具描述等识别潜在风险,利用协议属性和大语言模型自我反思能力迭代优化输出,有效减轻污点式漏洞利用。
RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体
机构 * Intuit AI Research(Intuit AI研究)
专题命中 工具调用 :tool-use(abstract);分类 cs.CL
AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。
Comments Published as a long paper in the main conference of ACL 2026
动态多车辆路径规划的奖励密度启发式算法:性能与计算效率
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 研究动态多车辆路径规划问题,提出奖励密度启发式算法(效率启发式算法),在自主无人机任务分配和城市出租车调度等领域评估,该算法与多种经典和元启发式算法比较,在奖励与计算前沿占优,解质量相当但规划时间少,为实时分配调度系统提供实用原则。
忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据
机构 * University of Southern Denmark(南部丹麦大学)
专题命中 工具调用 :agentic(abstract);分类 cs.AI
AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。
Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026
Akashic:一种基于内存注意力机制的低开销大语言模型推理服务
机构 * Xiaohongshu Inc.(小红书公司) ; ShangHai JiaoTong University(上海交通大学) ; Peking University(北京大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。
体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化
机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。
研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件
机构 * Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; National University of Singapore(新加坡国立大学) ; CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)
专题命中 工具调用 :workflow(abstract);分类 cs.AI
AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。
Comments Tech Report
激励视觉语言模型进行长视频问答搜索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 工具调用 :agentic(abstract);分类 cs.LG
AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。
Comments To appear at the European Conference on Computer Vision (ECCV 2026)
对基准进行基准测试:工具调用评估的有效性审计
专题命中 工具调用 :agent(abstract);分类 cs.SE
AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。