arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 39 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 39 篇

2608.01189 2026-08-04 cs.SE 新提交 87%

MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment

MADE:用于自主模型部署的信念驱动双智能体协调机制

Yicheng Liu, Bolin Zhang, Weiran Liu, Yakun Zhang, Yangqin Jiang, Zhiying Tu, Dianhui Chu

专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE

AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00218 2026-08-04 cs.CL 新提交 85%

A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use

少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导

Yutong Ke, Ming Yin, Chongwen Zhao, Kaizhu Huang

专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL

AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。

Comments 21 pages, 4 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 83%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 83%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01788 2026-08-04 cs.SE 版本更新 83%

KRCA: An Efficient Root Cause Analysis System in Hyper-scale Microservice Systems via Agentic AI

KRCA:一种基于智能体AI的超大规模微服务系统高效根因分析系统

Jiamin Jiang, Jingfei Feng, Yu Luo, Qingliang Zhang, Yongqian Sun, Wenwei Gu, Shenglin Zhang, Tianyu Cui, Yao Wu, Jielong Huang, Nan Qi, Dan Pei

专题命中 工具调用 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出KRCA系统,通过多阶段流水线(API级钻取、骨架因果图、记忆增强多智能体框架)实现超大规模微服务的高效根因定位与故障分类,AC@1达0.88和0.79,诊断时间减少77.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02464 2026-08-04 cs.AI cs.LG cs.SE 新提交 83%

Real-Time Detection and Repair of LLM Agent Failures

LLM智能体故障的实时检测与修复

Sunny Dubey

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。

Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06716 2026-08-04 cs.AI cs.CL cs.CR 版本更新 82%

SIEVE: Selective Integrity Verification and Escalation for Defending LLM Agents against Indirect Prompt Injection

认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架

Zhibo Liang, Tianze Hu, Zaiye Chen, Mingjie Tang

机构 * Sichuan University(四川大学)

专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 82%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 工具调用 :tool use(title,abstract);agentic(abstract)

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23993 2026-08-04 cs.CL cs.AI cs.DB cs.LG cs.MA 80%

EPM-RL: Reinforcement Learning for On-Premise Product Mapping in E-Commerce

EPM-RL:电商产品映射的强化学习方法

Minhyeong Yu, Wonduk Seo

机构 * AI Research, Enhans(AI研究,Enhans)

专题命中 工具调用 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EPM-RL框架,通过强化学习提升电商产品映射的准确性和效率,解决传统方法依赖外部API和高成本的问题,实现私有部署和低成本运营。

Comments preprint

Journal ref Proceedings of the AAAI Symposium Series, vol. 9, no. 1, p. 227, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 79%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24223 2026-08-04 cs.CL 版本更新 79%

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

相关性的新作用:在智能搜索中指导语料库交互

Jiangnan Li, Yuqing Li, Mo Yu, Jinchao Zhang, Jie Zhou

机构 * Tencent(腾讯) IIE-CAS(中国科学院计算技术研究所)

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.CL

AI总结 研究提出相关性在智能搜索中作用新观点,介绍相关性感知的RipGrep搜索代理RARG,它能将相关性转化为语料库交互执行先验,提供从粗到细的相关性指导,在浏览问答和检索中提升准确性与效率,实现更快更可靠的搜索收敛。

Comments code is available at https://github.com/LeqsNaN/RARG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 79%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 工具调用 :tool use(title);agentic(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 78%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 77%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 77%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 76%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01321 2026-08-04 cs.CL 新提交 74%

BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

BiCAA:面向搜索增强智能体的双向信用分配

Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10226 2026-08-04 cs.LG cs.AI 版本更新 73%

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

自进化推荐系统:基于LLM代理的端到端自主模型优化

Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

机构 * Google Inc(谷歌公司)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的自进化推荐系统,通过端到端自动化流程自主优化模型,提升开发效率和性能。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02518 2026-08-04 cs.AI cs.CY 新提交 70%

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

Magnet:通过能力累积检测跨会话的AI滥用

Natalie Isak, Matthew Dressman

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01822 2026-08-04 cs.AI 新提交 70%

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架

Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26775 2026-08-04 cs.LG cs.AI cs.CL cs.CV 67%

Learning to Select Visual In-Context Demonstrations

学习选择视觉上下文示例

Eugene Lee, Yu-Chi Lin, Jiajie Diao

机构 * University of Cincinnati(辛辛那提大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。

Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交 62%

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01913 2026-08-04 cs.AI cs.CL cs.IR 新提交 62%

Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents

长视野搜索智能体的搜索行为与失败模式诊断

Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

机构 * Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究通过轨迹级诊断区分长视野搜索智能体的检索与利用差距,发现搜索努力与答案质量弱相关,为优化深度研究系统提供了查询构建、证据管理等方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01056 2026-08-04 cs.AI cs.CL 新提交 62%

Control Under Compression: Reliability Frontiers for Tool-Using Agents

压缩下的控制:使用工具的智能体的可靠性边界

Yinghan Hou, Zongyou Yang

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对工具使用智能体的控制上下文压缩,提出CompressAgent基准,揭示压缩的非线性可靠性边界,发现压缩会引发工具执行等错误,需以可执行结果评估压缩效果。

Comments 12 pages, 5 figures; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07050 2026-08-04 cs.CL cs.LG 版本更新 62%

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

多教师在线策略蒸馏中的行为杠杆不平衡

Jiabin Shen, Guang Chen, Chengjun Mao

机构 * AntGroup(蚂蚁集团)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL、cs.LG

AI总结 研究多教师在线策略蒸馏中行为杠杆不平衡问题,提出Soft Clamp方法,通过校准令牌级散度,减少模型过度调用工具情况,在保持决策准确率的同时,降低工具调用循环和重复调用,提升多教师OPD效果。

Comments 33 pages, 5 figures. Code and aggregate artifacts: https://github.com/shen-jiabin/topk-support-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24925 2026-08-04 cs.LG cs.CL cs.IR 版本更新 62%

GraphER: An Efficient Graph-Based Enrichment and Reranking Method for Retrieval-Augmented Generation

GraphER: 一种高效的基于图的增强和重排序方法用于检索增强生成

Ruizhong Miao, Yuying Wang, Rongguang Wang, Chenyang Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 工具调用 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 GraphER通过利用数据组织结构捕捉超越语义相似性的接近关系,构建查询时的图结构并应用图排序技术,提升检索完整性,无需额外图基础设施,兼容标准向量存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02097 2026-08-04 cs.AI cs.IR 新提交 57%

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents

先获取再探索:面向搜索智能体的持久工作空间上选择与提取解耦

Qi Liu, Yiqun Chen, Zidan Chen, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对搜索智能体提出Fetch-then-Explore方法,将页面选择与证据提取解耦,在两个基准测试中提升了智能体的搜索性能,核心是通过持久工作空间实现页面复用与证据累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01904 2026-08-04 cs.AI 新提交 57%

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

CoEvoKG:用自演进搜索智能体协同演进知识图谱

Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai, Ping Jiang, Haoyu Wu, Minghui Wu, Chenxu Zhao, Jie Song, Guannan He

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01744 2026-08-04 cs.AI cs.GR 新提交 57%

RL-Lock: Reinforcement Learning for Generating Interlocking Assemblies

RL-Lock:用于生成互锁组件的强化学习

Xuyang Ma, Chaewoon Kim, Haonan Zhang, Rulin Chen, Ziqi Wang, Peng Song

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对现有互锁组件生成方法依赖手工启发式、难处理复杂案例的问题,研究人员提出强化学习框架RL-Lock,结合结构化动作分块与MCTS学习,高效生成互锁组件,在复杂场景表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01565 2026-08-04 cs.CL 新提交 57%

DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Question Answering

DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG

Dongyang Xie, Yao Tian, Hao Zhang, Yifei Yuan, Tieyun Qian, Ming Zhong, Jiawei Jiang, Yuanyuan Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。

Comments 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏