arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-04 至 2026-08-04 共收录 263 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 26 篇

2608.01189 2026-08-04 cs.SE 新提交 87%

MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment

MADE:用于自主模型部署的信念驱动双智能体协调机制

Yicheng Liu, Bolin Zhang, Weiran Liu, Yakun Zhang, Yangqin Jiang, Zhiying Tu, Dianhui Chu

专题命中 工具调用 :agent(title,summary_cn);分类 cs.SE

AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00218 2026-08-04 cs.CL 新提交 85%

A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use

少量神经元可揭示大语言模型何时滥用工具:用于可靠工具使用的稀疏检测与选择性引导

Yutong Ke, Ming Yin, Chongwen Zhao, Kaizhu Huang

专题命中 工具调用 :tool use(title);agentic(abstract,abstract_cn);tool-use(abstract);分类 cs.CL

AI总结 本研究提出PRISMS框架,利用少量特定MLP神经元实现大语言模型工具使用故障的稀疏检测与选择性引导,可跨模型系列降低过度调用率、提升工具所需准确率。

Comments 21 pages, 4 figures. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 83%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00969 2026-08-04 cs.AI 新提交 83%

PROGRESS: Coverage-guided RL to Train Search-augmented LLM Agent

PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体

Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Aounon Kumar, Yashas Malur Saidutta, Wenbo Li, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02464 2026-08-04 cs.AI cs.LG cs.SE 新提交 83%

Real-Time Detection and Repair of LLM Agent Failures

LLM智能体故障的实时检测与修复

Sunny Dubey

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究提出基于LLM智能体步骤遥测的实时故障检测与修复系统,结合单类回声状态网络集成与确定性验证层,可高效检测并修复故障,提升任务成功率且成本极低。

Comments 16 pages, 5 figures. Code, data and demo: github.com/sunnydubey1111/agent-trajectory-sentinel Walkthrough: youtu.be/a05n_000klE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 82%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 工具调用 :tool use(title,abstract);agentic(abstract)

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 79%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 78%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02358 2026-08-04 cs.CL 新提交 77%

ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索

Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 77%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 工具调用 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01388 2026-08-04 cs.CR cs.AI cs.LG 新提交 76%

Why Formal Monitors Fail: Attack Distribution Entropy as a Coverage Bound for LTL-Based LLM Agent Safety

形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界

Ruiyang Zhang

专题命中 工具调用 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。

Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01321 2026-08-04 cs.CL 新提交 74%

BiCAA: Bidirectional Credit Assignment for Search-Augmented Agent

BiCAA:面向搜索增强智能体的双向信用分配

Yibin Huang, Bin Xu, Hailong Cao, Conghui Zhu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02518 2026-08-04 cs.AI cs.CY 新提交 70%

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

Magnet:通过能力累积检测跨会话的AI滥用

Natalie Isak, Matthew Dressman

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对AI集成体的跨会话滥用风险,提出Magnet方法,通过聚合跨会话累积的相关能力来检测此类滥用,填补了现有单会话检测的缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01822 2026-08-04 cs.AI 新提交 70%

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架

Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交 62%

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01913 2026-08-04 cs.AI cs.CL cs.IR 新提交 62%

Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents

长视野搜索智能体的搜索行为与失败模式诊断

Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

机构 * Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究通过轨迹级诊断区分长视野搜索智能体的检索与利用差距,发现搜索努力与答案质量弱相关,为优化深度研究系统提供了查询构建、证据管理等方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01056 2026-08-04 cs.AI cs.CL 新提交 62%

Control Under Compression: Reliability Frontiers for Tool-Using Agents

压缩下的控制:使用工具的智能体的可靠性边界

Yinghan Hou, Zongyou Yang

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对工具使用智能体的控制上下文压缩,提出CompressAgent基准,揭示压缩的非线性可靠性边界,发现压缩会引发工具执行等错误,需以可执行结果评估压缩效果。

Comments 12 pages, 5 figures; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02097 2026-08-04 cs.AI cs.IR 新提交 57%

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents

先获取再探索:面向搜索智能体的持久工作空间上选择与提取解耦

Qi Liu, Yiqun Chen, Zidan Chen, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对搜索智能体提出Fetch-then-Explore方法,将页面选择与证据提取解耦,在两个基准测试中提升了智能体的搜索性能,核心是通过持久工作空间实现页面复用与证据累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01904 2026-08-04 cs.AI 新提交 57%

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

CoEvoKG:用自演进搜索智能体协同演进知识图谱

Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai, Ping Jiang, Haoyu Wu, Minghui Wu, Chenxu Zhao, Jie Song, Guannan He

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01744 2026-08-04 cs.AI cs.GR 新提交 57%

RL-Lock: Reinforcement Learning for Generating Interlocking Assemblies

RL-Lock:用于生成互锁组件的强化学习

Xuyang Ma, Chaewoon Kim, Haonan Zhang, Rulin Chen, Ziqi Wang, Peng Song

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对现有互锁组件生成方法依赖手工启发式、难处理复杂案例的问题,研究人员提出强化学习框架RL-Lock,结合结构化动作分块与MCTS学习,高效生成互锁组件,在复杂场景表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01565 2026-08-04 cs.CL 新提交 57%

DocNavRAG: Document-Structured Graph RAG with Stateful Evidence Construction for Complex Document Question Answering

DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG

Dongyang Xie, Yao Tian, Hao Zhang, Yifei Yuan, Tieyun Qian, Ming Zhong, Jiawei Jiang, Yuanyuan Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。

Comments 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00974 2026-08-04 cs.AI 新提交 57%

Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

Search-GRT:面向复杂问答任务优化的搜索智能体引导检索训练

Aounon Kumar, Sudipta Paul, Vivek Kulkarni, Vijay Srinivasan, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对LLM搜索的奖励稀疏问题,提出GRT方法,通过真实信息限制检索过程,在多跳问答等任务上实现超40%性能提升并提高训练效率。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00902 2026-08-04 cs.CL 新提交 57%

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

面向LLM智能体的实用在线KV缓存压缩:一项实证研究

Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) LinkedIn(领英公司)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02414 2026-08-04 cs.DC cs.PF 新提交 50%

Analyzing GPU Performance in Virtualized Environments: A~Case Study

虚拟化环境中的GPU性能分析:一项案例研究

Adel Belkhiri, Michel Dagenais

专题命中 工具调用 :tool use(abstract)

AI总结 本文针对当前性能工具不支持虚拟GPU(vGPU)的问题,提出一款兼容Intel GVT-g的新型性能分析工具,通过软件追踪技术收集数据并生成指标,助力识别vGPU虚拟机的性能瓶颈。

Comments 18 pages, 12 figures, 5 tables

Journal ref Future Internet 2024, 16, 72

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01789 2026-08-04 cs.NE 新提交 50%

Towards Autonomous Formulaic Alpha Discovery: An Evolutionary Computation Perspective

面向自主公式化阿尔法发现:进化计算视角

Xinwei Yu, Yiyang Fu, Mingcheng Fan, Enqi Li, Yilin Gao, Shugong Xu

专题命中 工具调用 :agentic(abstract)

AI总结 本文从进化计算视角,提出自动化公式化阿尔法发现的统一分析与评估框架,为开发可靠的自主阿尔法发现系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 工具调用 :tool-use(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 73 篇

2608.02422 2026-08-04 cs.CR cs.AI 新提交 89%

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

基于数字孪生增强多尺度规划的智能体事件响应

Yiran Gao, Tao Li, Kim Hammar

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。

Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00805 2026-08-04 cs.AI 新提交 87%

AgentSLABench: Evaluating and Benchmarking Agentic Systems Under Resource Constraints

AgentSLABench:资源约束下智能体系统的评估与基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 规划决策 :agentic(title);planning(abstract,abstract_cn);agent(abstract);AI agent(abstract)

AI总结 本研究提出AgentSLABench框架,在资源约束下评估自主AI智能体,通过多维度指标分析发现专用智能体表现优于通用基线,验证了效率调整成功率的重要性并开放相关资源。

Comments 7 pages, 2 figures, 9 tables. Code, sealed test sets, and profiling artifacts available at: https://github.com/MeherBhaskar/agentslabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 85%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 规划决策 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交 85%

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏