arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-09 至 2026-06-09 共收录 24 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 24 篇

2606.07846 2026-06-09 cs.DC cs.AI cs.MA 新提交 90%

Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method

成本感知的LLM-Agent工作流投机执行:一种综合五维方法

Faisal Fareed

机构 * AWS(亚马逊网络服务)

专题命中 工具调用 :agent(title,title_cn);分类 cs.AI

AI总结 提出一种五维投机执行方法,通过贝叶斯概率估计和成本定价,在LLM-Agent工作流中平衡延迟与成本,并确保无副作用回滚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09032 2026-06-09 cs.CL 新提交 85%

Bridging the Agent-World Gap: Text World Models for LLM-based Agents

弥合智能体-世界鸿沟:面向基于LLM的智能体的文本世界模型

Yixia Li, Hongru Wang, Peng Lai, Zhiwen Ruan, He Zhu, Youxin Zhu, Ganlong Zhao, Minda Hu, Yun Chen, Sibei Yang, Peng Li, Jeff Z. Pan, Jia Pan, Guanhua Chen, Yang Liu, Guanbin Li

机构 * Southern University of Science and Technology(南方科技大学) University of Edinburgh(爱丁堡大学) Peking University(北京大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.CL

AI总结 本文系统综述了面向基于LLM的智能体的文本世界模型,围绕形式化框架和智能体生命周期,涵盖基础定义、构建范式、应用(训练时经验合成与推理时规划、验证、适应)及评估,旨在整合该领域并明确设计空间与开放挑战。

Comments Code: https://github.com/sustech-nlp/awesome-text-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 84%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09138 2026-06-09 cs.LG cs.CL 新提交 84%

Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning

Claw-R1:面向智能体强化学习的步骤级数据中间件系统

Daoyu Wang, Mingyue Cheng, Qingchuan Li, Shuo Yu, Jie Ouyang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 提出Claw-R1系统,通过网关服务器和数据池组件,将智能体交互步骤转化为结构化数据资产,支持实时检查、质量筛选和训练批次配置,解决智能体强化学习中数据生命周期管理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08696 2026-06-09 cs.LG cs.AI 新提交 81%

Agentic Search for Counterfactual Recourse under Fixed LLM Budgets

固定LLM预算下的反事实追索的智能搜索

Yasuo Tabei

机构 * RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Comp-MCTS框架,在固定LLM调用预算下,通过树搜索最大化生成唯一且经oracle验证的反事实,平衡数量与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09071 2026-06-09 cs.AI 新提交 79%

REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

REFLECT: 针对LLM智能体轨迹中静默失败的干预支持错误归因

Xiaofeng Lin, Yingxu Wang, Tung Sum Thomas Kwok, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 提出REFLECT方法,通过诊断候选错误步骤、使用诊断特定补丁进行受控重放测试,并利用验证结果作为对比证据来细化归因,在四个基准上取得最高定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08539 2026-06-09 cs.AI 新提交 79%

AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions

AgentTrust: AI代理行为的自改进信任层

Chenglin Yang

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 提出AgentTrust v2,通过威胁类型分类(词汇/语义)和自学习机制,在代理行为中实现自改进信任决策,显著提升语义威胁检测准确率并降低误拦。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-06-09 cs.CL 新提交 77%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07992 2026-06-09 cs.AI cs.CR cs.SE 新提交 73%

VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation

VATS: 通过系统性变异利用错误路径注入中的隐式权威

Harshil Patel, Kunal Pai

机构 * Harshil Patel Kunal Pai

专题命中 工具调用 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。

Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09315 2026-06-09 cs.CR cs.AI 新提交 70%

Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents

脑提示注入:BCI-LLM代理的路径安全审计

Jianwei Tai

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 提出路径安全审计契约,通过分离定理和共形校准量化BCI-LLM代理中脑信号注入攻击的风险,实验证明确认通道可降低路由风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07595 2026-06-09 cs.CV cs.AI cs.IR 新提交 70%

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

VisualLeakBench: 视觉语言智能体中可复现的动作边界传播失败

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 提出VisualLeakBench基准,评估视觉语言智能体在截图、文档等场景下将敏感文本从图像复制到工具参数中的动作边界传播失败,发现PII传播率达78.8%,不安全文本传播率达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07538 2026-06-09 cs.IR cs.AI 新提交 70%

Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents

面向遥感智能体的双向语义互补工具检索

Zeyuan Wang, Dongyang Hou, Cheng Yang, Xuezhi Cui, Linrui Xu, Bo Yu, Gaozhi Zhou, Ziyu Li, Liangtian Liu, Kai Ouyang, Wang Guo, Lili Zhu, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Mechanical and Electrical Engineering, Central South University(机械与电子工程学院,中南大学) Hunan Key Laboratory of Land Resources Evaluation and Utilization, Hunan Provincial Institute of Land and Resources Planning(湖南省国土资源评价与利用重点实验室,湖南省国土资源规划院)

专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 针对遥感智能体工具检索中查询与文档语义不对称问题,提出双向语义互补方法:通过规划增强查询机制补充功能语义,利用动态工具依赖图注入上下文语义,显著提升复杂遥感任务工具检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12735 2026-06-09 cs.SE 版本更新 70%

OOPS: Automated generation of REST API specification via LLMs

OOPS: 通过大语言模型自动生成REST API规范

Hao Chen, Yunchun Li, Chen Chen, Fengxu Lin, Wei Li

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 提出OOPS方法,利用LLM对服务器代码进行静态分析,通过端点方法提取和OAS生成两步工作流,自动生成高质量OpenAPI规范,无需技术特定规则或人工干预。

Journal ref Journal of Systems and Software 239 (2026) 112914

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09659 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

End-to-End Context Compression at Scale

端到端上下文压缩的规模化

Ang Li, Sean McLeish, Haozhe Chen, Nimit Kalra, Zaiqian Chen, Artem Gazizov, Venkata Anoop Suhas Kumar Morisetty, Bhavya Kailkhura, Harshitha Menon, Zhuang Liu, Brian R. Bartoldson, Tom Goldstein, Sanae Lotfi, Micah Goldblum, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(Modal实验室) University of Maryland(马里兰大学) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) FAIR at Meta(Meta FAIR实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究通过架构搜索和持续预训练,提出潜在上下文语言模型(LCLMs),一种端到端编码器-解码器压缩器,在通用任务性能、压缩速度和峰值内存上改进帕累托前沿,并可作为长时智能体的高效骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09186 2026-06-09 cs.HC 新提交 67%

DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction

DuplexOmni:用于全双工交互的实时听、看、思考和说话

Muye Huang, Lingling Zhang, Xingyu Yu, Lei Shi, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jun Liu

专题命中 工具调用 :tool use(abstract);tool-use(abstract)

AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27476 2026-06-09 cs.CV 版本更新 67%

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM: 为视觉-语言模型高效边缘推理设计的框架

Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

机构 * Go Further. AI School of Data Science Fudan University(复旦大学数据科学学院) RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) Independent Researcher(独立研究者)

专题命中 工具调用 :agent(abstract);AI agent(abstract)

AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。

Comments Technique Report version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09416 2026-06-09 cs.RO cs.AI cs.SE 新提交 62%

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

面向物理AI的驾驭工程:机器人中间件即驾驭层

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出机器人中间件作为物理AI的驾驭层,需同时干预控制、计算和通信,并补充投影、隔离和转移三种缺失的强制功能,以ROS 2驾驭配置文件为例。

Comments 6 pages, 2 figures, 2 tables. Big Ideas track submission to the 27th ACM/IFIP International Middleware Conference (Middleware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07904 2026-06-09 cs.AI cs.SE 新提交 62%

Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents

Contract2Tool: 学习可靠工具增强型LLM代理的前提条件和效果

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Contract2Tool框架,从元数据、文档和执行轨迹中推断工具契约,实现因果工具过滤,在保持可靠性的同时大幅减少工具选择和token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09062 2026-06-09 cs.CR cs.SE 新提交 57%

Security-First Approach to API Pipeline Development with Zero-Trust Architecture

基于零信任架构的API管道开发安全优先方法

Mahima Agarwal, Keshav Ranjan

专题命中 工具调用 :planning(abstract);分类 cs.SE

AI总结 针对API攻击激增和漏洞利用加速的现状,提出一种结合零信任架构和DevSecOps的五支柱安全优先框架,通过治理、设计、测试、管道控制和运行时防护,显著减少安全事件和发布后漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07709 2026-06-09 cs.SE 新提交 57%

Are We Lost in the Woods? Detecting Silent Semantic Faults for Random Forest Classifiers with Data-informed Static Analysis

我们是否迷失在森林中?通过数据驱动的静态分析检测随机森林分类器的静默语义故障

Willem Meijer, Louis Ohl, Kristian Sandahl, Daniel Varro

专题命中 工具调用 :agentic(abstract);分类 cs.SE

AI总结 提出一种数据驱动的静态分析技术,通过提取ML流水线为有向无环图并对照形式化API契约评估,以检测随机森林分类器中的静默语义故障,实现高精度(91%)和亚秒级运行时开销。

Comments 11 pages + 2 pages with references, 4 figures, 3 tables, 2 code listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22763 2026-06-09 cs.AI 版本更新 57%

Advancing Mathematics Research with AI-Driven Formal Proof Search

用AI驱动的形式证明搜索推进数学研究

George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferraiuolo, Henryk Michalewski, Edward Lockhart, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri

机构 * Google DeepMind(谷歌DeepMind) Aarhus University(奥胡斯大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文研究了如何利用大型语言模型生成形式证明,以解决开放性数学问题,并展示了AI辅助形式证明搜索在数学研究中的应用和贡献。

Comments The first three authors and the last author have equal contributions. The first three authors are in random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21964 2026-06-09 cs.SE 版本更新 57%

DRS-OSS: A Diff-Risk Scoring Tool for Continuous Integration Workflows

DRS-OSS:用于持续集成工作流的差异风险评分工具

Ali Sayedsalehi, Peter C. Rigby, Audris Mockus

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 提出开源差异风险评分工具DRS-OSS,通过可部署管道结合提交信息、差异和变更指标预测风险,在ApacheJIT上达到0.895 ROC-AUC,优于基线。

Comments 5 pages, 4 figures, 4 tables. Tool demonstration paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18383 2026-06-09 stat.ME stat.AP 50%

A tutorial on conducting sample size and power calculations for detecting treatment effect heterogeneity in cluster randomized trials with linear mixed models

如何在基于线性混合模型的集群随机试验中进行样本量和功效计算以检测治疗效应异质性

Mary Ryan Baumann, Monica Taljaard, Patrick J. Heagerty, Michael O. Harhay, Guangyu Tong, Rui Wang, Fan Li

专题命中 工具调用 :planning(abstract)

AI总结 本文探讨了在集群随机试验中使用线性混合模型检测治疗效应异质性的样本量和功效计算方法,提供了计算工具和关键考虑因素。

Comments v3: accepted, 33 pages (19 main, supplemental 14); v2: revision under review, 36 pages (main 22, supplemental 14); v1: 28 pages, 4 tables, 5 figures

Journal ref International Journal of Epidemiology (2026) Volume 55, Issue 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12183 2026-06-09 cs.RO 版本更新 50%

An Interval Branch-and-Bound-Based Inverse Kinemetics Algorithm Towards Global Optimal Redundancy Resolution

基于区间分支定界的逆运动学算法实现全局最优冗余度解析

Yajue Yang, Zeqing Zhang, Yuanqing Wu, Jia Pan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :planning(abstract)

AI总结 提出一种结合快速数值IK求解器搜索启发式的区间分支定界方法,高效求解机械臂广义逆运动学问题,生成邻域解以提供自运动流形的丰富几何信息,支持最优规划和任意时间求解。

详情

展开后加载摘要…

URL PDF HTML 收藏