arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 13 篇

2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 87%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agentic(title,summary_cn);分类 cs.AI

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11977 2026-08-13 cs.AI 新提交 85%

Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection

重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略

Chaoran Chen, Vy Nguyen, Ziji Zhang, Abhinav Gullapalli, Ziyi Wang, Yuxuan Lu, Dakuo Wang, Jing Huang, Zhou Yu, Jin Lai

机构 * Amazon(亚马逊)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交 85%

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 83%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00316 2026-08-13 cs.LG stat.ML 版本更新 83%

Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch

基于代理的贝叶斯优化:通过代理增强的自动研究

Paul Brunzema, Louis Tiao, Nhat Le, Kevin De Angeli, Yao Xuan, Djordje Gligorijevic

机构 * Meta RWTH Aachen University(亚琛工业大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11715 2026-08-13 cs.CL cs.AI 新提交 76%

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

当API“说错”语言:重新审视多语言工具使用的后训练

Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

机构 * Amazon(亚马逊)

专题命中 工具调用 :tool use(title);分类 cs.AI、cs.CL

AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11250 2026-08-13 cs.AI cs.MA q-fin.CP q-fin.PM 新提交 74%

AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search

AgonAlpha:通过提示经济与可扩展智能体搜索实现自主阿尔法发现

Weicheng Ye, Youran Sun, Xingyu Ren, Shunyao Yu, Chugang Yi, Haizhao Yang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland(马里兰大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 AgonAlpha是首个结合经验证构件搜索、对抗审核器与并行预算分配的阿尔法挖掘系统,在WorldQuant BRAIN部署后产出SPECTACULAR级阿尔法,为交易因子自主研究提供了完整证据轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26722 2026-08-13 cs.MA cs.LG 版本更新 70%

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo:提炼重校准的历史经验以实现工具链自主进化

Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 针对现有工具链自主进化方法的两个局限,提出DREvo方法,通过整合三项技术提升进化稳定性,在五个基准上取得最优准确率,在两类任务上较基线实现显著性能提升。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11552 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents

超越单轮置信度:面向大语言模型智能体的轨迹适配不确定性量化

Dylan Bouchard, Mohit Singh Chauhan

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究探讨单轮UQ方法能否迁移至LLM智能体的交互式轨迹场景,评估三类UQ方法在多轮工具使用数据集上的表现,发现黑盒自一致性通常最优,提示需在轨迹层面重新验证单轮UQ方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10694 2026-08-13 cs.LG cs.AI cs.CL cs.NE 版本更新 67%

Optimize Cheap, Deploy Strong: Cost-Aware Cross-Tier Transfer for Evolutionary Optimization

优化低成本部署强模型:面向进化优化的成本感知跨层迁移

Tal Oved, Roi Pony, Oshri Naparstek, Udi barzelay

机构 * IBM Research(IBM研究院)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出成本感知跨层迁移方法,解耦LLM角色,在低成本层级完成大部分搜索,跨层部署提示词,在多任务多模型上实现成本大幅降低且性能不劣于同层级优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 57%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12039 2026-08-13 cs.DM 新提交 50%

Search and Rescue on the Plane

平面上的搜索与救援问题

Jared Coleman, Evangelos Kranakis, Danny Krizanc, Oscar Morales-Ponce

专题命中 工具调用 :agent(abstract)

AI总结 该研究针对平面搜索与救援问题,确定临界角$\theta^* \approx 15.6^\circ$,据此给出不同角度下智能体的最优检查点,推导竞争比闭式表达式,优化搜索与交付的竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21392 2026-08-13 cs.CR 版本更新 50%

VIPER-MCP: Detecting and Exploiting Taint-Style Vulnerabilities in Model Context Protocol Servers

VIPER-MCP: 检测和利用模型上下文协议服务器中的污点式漏洞

Pengyu Sun, Zifeng Kang, Qishu Jin, Enhao Huang, Xin Liu, Dakun Shen, Song Li

专题命中 工具调用 :agent(abstract)

AI总结 本文提出VIPER-MCP,一种用于模型上下文协议服务器的端到端自动漏洞审计框架,能够检测污点式漏洞并动态验证其可利用性,通过生成具体的概念验证提示。该框架引入了两种新技术:一种是双阶段静态分析策略中的锚查询,增强了标准污点警报的功能性上下文;另一种是反馈驱动的提示进化机制,通过双变异调度和适应度评分的种子选择,逐步优化自然语言提示以达到易受攻击的sink。

详情

展开后加载摘要…

URL PDF HTML 收藏