arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-03 至 2026-08-03 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 8 篇

2607.26497 2026-08-03 cs.CL 版本更新 84%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 工具调用 :agent(summary_cn,abstract);agentic(abstract);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交 83%

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29175 2026-08-03 cs.SE 新提交 79%

Execution-First Synthetic Tool-Use Trace Generation for LLM Agents

面向LLM智能体的优先执行式合成工具使用轨迹生成

Hafsa Ouajdi, Francesco Giannuzzo, Alaa Boukhary, Paolo Papotti, Gerard Conangla, Adam Elwood

专题命中 工具调用 :tool-use(title);agentic(abstract);分类 cs.SE

AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13683 2026-08-03 cs.CL 版本更新 79%

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

通过门控语义质量多样性实现自我进化智能体的驾驭

Xiaotian Luo, Dizhan Xue, Fengxingyu Wang, Chuanrui Hu, Yafeng Deng

专题命中 工具调用 :agent(title,abstract);分类 cs.CL

AI总结 研究大语言模型智能体驾驭因素提升性能的问题,提出自我进化智能体驾驭框架,将提出与评估更改分开,通过门控存档避免过度拟合,在多领域测试中取得较好泛化效果,证明诊断与评估循环的有效性。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 77%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 工具调用 :tool-use(abstract);function calling(abstract);agentic(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29468 2026-08-03 cs.AI 新提交 57%

Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember

自博弈与技能演化:能提出、解决并记忆的自演化搜索智能体

Zenghuang Fu, Zhaoyang Li, Qiuyuan Ai, Haoyu Wu, Minghui Wu, Chenxu Zhao, Ante Wang, Guannan He, Changwei Wang

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本研究提出SESA智能体,通过任务生成与技能记忆的双向循环协同演化,在7个问答基准上较SSP、SkillRL等基线实现准确率提升,且支持无记忆部署与可选推理检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28854 2026-08-03 cs.LG 新提交 57%

An analysis of machine learning approaches for enhancing decision-making in complex discrete choice tasks

用于增强复杂离散选择任务决策的机器学习方法分析

Sheng Lun Christine Cao, Destenie Nock, Alex Davis

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本研究分析四种机器学习模型在复杂离散选择任务中学习和预测五类选择规则的性能,发现半参数及非参数模型总体优于参数模型,孪生神经网络在能源政策偏好案例中表现最佳。

Comments Published in Decision Analytics Journal, Dec 16 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07774 2026-08-03 cs.CR 版本更新 50%

ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents

ScopeJudge:用于进攻性安全代理的成本感知预执行门控

Shane Caldwell, Max Harley, Ads Dawson, Michael Kouremetis, Vincent Abruzzo, Will Pearce

专题命中 工具调用 :agent(abstract)

AI总结 研究进攻性安全代理中预执行门控,引入ScopeJudge数据集,含4897个工具调用。评估八个法官模型在五种转录策略下表现,发现静态策略不足,推荐成本敏感和召回优先操作点,以支持自主安全代理的实时监控和可扩展监督。

Comments 22 pages, 4 figures, 4 tables, 1 link to code, 1 link to dataset

详情

展开后加载摘要…

URL PDF HTML 收藏