arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-07 至 2026-08-07 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 20 篇

2608.05738 2026-08-07 cs.RO 新提交 88%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 工具调用 :agentic(title,abstract);tool use(title);tool-use(abstract)

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06130 2026-08-07 cs.CR cs.AI cs.LG 新提交 87%

Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture

AI智能体签名工作流的硬件密钥存储:零信任MCP实施架构

Leo Sambrook, Sampo Sovio

专题命中 工具调用 :AI agent(title,abstract);agent(title,comments);分类 cs.AI、cs.LG

AI总结 该研究针对AI智能体私钥易泄露问题,提出基于硬件密钥存储与五层零信任栈的架构,实验显示其攻击成功率降为0%且无误报。

Comments 11 pages, 2 figures. Accompanying code and artifacts available at: https://anonymous.4open.science/r/Hardware-Keystores-for-AI-Agent-Signing-Workflows-Artifact-357C

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06270 2026-08-07 cs.AI 新提交 83%

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 工具调用 :tool-use(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 83%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21806 2026-08-07 cs.SE 版本更新 83%

Where Agent Frameworks Fall Short: Examining Functional Challenges and Usability Concerns

对现代LLM代理框架中缺陷的实证研究

Xinxue Zhu, Yanzhou Mu, Xiaoyu Zhang, Tianlin Li, Chao Shen, Chunrong Fang, Yang Liu, Juan Zhai

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05493 2026-08-07 cs.PL cs.AI cs.CL cs.SE 新提交 82%

Learning Context-Free Grammars for Grammar-Constrained Decoding via Declarative Agentic Programming with Guarantees

通过带保障的声明式智能体编程学习用于语法约束解码的上下文无关文法

Kevin Cheang, Geoff Hulette, Rahul Kumar, Felipe R. Monteiro, Federico Mora, Robin Salkeld, Lin Tan, Serdar Tasiran

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本研究提出名为Autogrammar的声明式智能体,可从文档和执行数据自动学习上下文无关文法,用于语法约束解码,在三种DSLs上的实验显示其生成的文法性能优于现有基线,能显著提升端到端LM的真实任务表现。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05987 2026-08-07 cs.AI cs.LG 新提交 81%

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

AgentOPSD:面向智能体强化学习的递归自蒸馏方法

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu, Jie Wu, Zhengzhou Cai, Yueqing Sun, Ziang Ye, Linji Hao, Qi Gu, Xunliang Cai, Yongliang Shen, Yujiu Yang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Meituan(美团)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 AgentOPSD 这一无 critic 的递归自蒸馏方法,用于智能体强化学习的轮次级 credit 分配,在 ALFWorld 等数据集上优于 GRPO 等基线,在 Qwen2.5-7B 模型上实现 ALFWorld 89.1% 的成功率。

Comments Code: https://github.com/ZethWang/AgentOPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09297 2026-08-07 cs.SE cs.AI 版本更新 81%

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO:软件工程中代理技能的多目标优化

Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang

机构 * King's College London(伦敦国王学院) Queen's University Belfast(贝尔法斯特女王大学) Nanjing University(南京大学) Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) University College London(伦敦大学学院) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06057 2026-08-07 cs.AI 新提交 79%

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

当历史失效:在误导性多轮历史下评估与改进工具使用

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI

AI总结 该研究针对多轮历史误导导致的工具调用智能体决策问题,提出可靠状态策略迁移方法,构建配对基准bench,在Qwen3模型上实现了优于多种基线的工具使用准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05628 2026-08-07 cs.AI 新提交 79%

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 SkillHEX是结合假设驱动自验证与证据引导树搜索的闭环框架,在SkillsBench87个任务上,5次迭代预算下用GPT-5.3-Codex和Claude Opus 4.7分别获55.9%、57.9%平均通过率,优于现有自演化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00737 2026-08-07 cs.AI 版本更新 77%

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

调用还是不调用:评估和优化LLM工具调用的框架

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德姆鲁尔大学) UAR RC Trust(UAR RC信托)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02376 2026-08-07 cs.DB cs.CL cs.IR 版本更新 74%

Token-Native Storage: Read and Write in your Agent's Language

令牌原生存储:以智能体的语言进行读写

Kumar Shivendu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出令牌原生存储思路,将文本以模型的BPE令牌ID保存,压缩比和读写速度均优于UTF-8等字节编码,呼吁AI实验室标准化令牌化器以推进该方案。

Comments 12 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06370 2026-08-07 cs.CL 新提交 70%

The Bitter Lesson of Tool Calling

工具调用的惨痛教训

Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05519 2026-08-07 cs.AI cs.CL cs.LG 新提交 69%

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

EcoAgent-Bench:评估预算约束下大语言模型智能体的经济决策能力

Jie Wu, Ming Gong, Feixiang Cheng, Qinqin Zhao

专题命中 工具调用 :agent(abstract,comments);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EcoAgent-Bench基准,评估大语言模型智能体在预算约束下的经济决策能力,发现现有智能体在该任务上表现不佳,发布了相关研究资源。

Comments 8 pages, 3 figures, 4 tables. Benchmark, dataset (304 budget-conditioned agent tasks), and evaluation harness; artifacts to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02091 2026-08-07 cs.LG cs.AI cs.CL cs.DB 版本更新 67%

CRINN: Contrastive Reinforcement Learning for Approximate Nearest Neighbor Search

CRINN:用于近似最近邻搜索的对比强化学习

Xiaoya Li, Albert Wang, Guoyin Wang, Chris Shum, Jiwei Li

机构 * DeepReinforce Team(深强化团队)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对近似最近邻搜索算法,提出CRINN新范式,将其优化视为强化学习问题,以执行速度为奖励信号,实验证明该方法在多个基准数据集上有效,且其成功验证了强化学习增强语言模型用于算法优化的有效性。

Comments Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00152 2026-08-07 cs.CR cs.AI 版本更新 57%

PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say

PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou, Dongrui Liu, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Southeast University(东南大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05301 2026-08-07 stat.ME 新提交 50%

Precision and Decisiveness as Goals: Reliable Sequential Hypothesis Testing with a Dual Stopping Criterion

以精度和决断性为目标:采用双重停止准则的可靠序贯假设检验

Eyal A. Kazin

专题命中 工具调用 :planning(abstract)

AI总结 该研究提出DPitG方法,结合精度目标与明确裁决,将PitG的不确定率从62%降至2%且零假阳性,符合预注册标准,适用于需可靠裁决的场景。

Comments Main section 17 pages and 9 figures, Seven Abstracts in 7 pages and 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06007 2026-08-07 cs.DC 新提交 50%

TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure

TensorCast:大语言模型基础设施中缺失的张量管理层

Yuhan Zhou, Yuchu Luo, Hao Nie, Wangrunze Lv, Yu Zhou, Yibo Zhu, Daxin Jiang, Chenren Xu

专题命中 工具调用 :agent(abstract)

AI总结 该研究针对LLM基础设施中张量管理策略复用受阻的问题,提出TensorCast分布式张量管理层,将张量状态管理与计算逻辑解耦,在保持性能的同时提升多轮智能体工作负载的TTFT达93.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02018 2026-08-07 cs.CV 版本更新 50%

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标

Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei Zhang

专题命中 工具调用 :agent(abstract)

AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11323 2026-08-07 stat.ME 版本更新 50%

Bayesian Optimization for Identification of Optimal Biological Dose Combinations in Personalized Dose-Finding Trials

用于个性化剂量探索试验中最佳生物剂量组合识别的贝叶斯优化方法

James Willard, Shirin Golchi, Erica EM Moodie

专题命中 工具调用 :agent(abstract)

AI总结 针对个性化剂量探索试验样本量小、难识别最佳生物剂量组合的问题,提出融合疗效与毒性信息的贝叶斯优化方法,经模拟验证其表现良好。

Comments 4 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏