arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-05 至 2026-08-05 共收录 138 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 11 篇

2608.02650 2026-08-05 cs.AI cs.SE 新提交 90%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 工具调用 :tool-use(title,abstract);planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02611 2026-08-05 cs.DC cs.AI cs.LG cs.SE 新提交 82%

KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization

KernelBrain:面向智能体的GPU内核优化的粗到细、预算感知搜索

Shuai Che, Gang Peng

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 KernelBrain是结合LLM引导变异等技术的GPU内核优化智能体,可提升内核质量与搜索效率,在Triton内核任务中获多倍加速且缩短优化时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 81%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 81%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02645 2026-08-05 cs.SE cs.AI 新提交 81%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03403 2026-08-05 cs.AI 新提交 79%

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

通过经验驱动的自适应指导实现智能体的鲁棒工具使用

Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 本研究针对智能体工具使用鲁棒性不足的问题,提出ExpG机制,经实验验证其可提升多类工具任务性能,还能让小模型智能体超越未用该机制的大模型智能体。

Comments Preprint.14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 79%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 工具调用 :tool use(title,abstract);分类 cs.SE

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02698 2026-08-05 cs.CR cs.AI 新提交 79%

Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach

使用工具的智能体群体中自适应隐式合谋的隐写分析:一种黑盒跨主体方法

Mohamed Chahine Ghanem

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对使用工具的LLM智能体群体的自适应隐式合谋,构建结合多类方法的黑盒隐写分析检测器,开展红蓝对抗实验,绘制检测容量边界并发现新的规避手段。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 78%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 工具调用 :agentic(title,abstract)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 57%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 32 篇

2608.02876 2026-08-05 cs.AI 新提交 88%

BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL

BAP-SQL:面向智能体Text-to-SQL的预算感知观测规划

Chong Peng, Pin Qian, Su Wang, Yihang Chen, Varun Sah

机构 * Microsoft(微软公司) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 BAP-SQL是面向智能体Text-to-SQL的预算感知观测规划方法,通过将观测形成作为预算控制阶段,在紧预算下提升了SQL生成成功率,同时减少了token使用量。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03009 2026-08-05 cs.CR 新提交 87%

Tiny Enough to Break In: Agentic Remote Access Trojans Powered by Small Language Models

小到足以突破:由小型语言模型驱动的智能体远程访问木马

Yuhan You, Suhas Adavelly, Victoria Lovelace, Cameron Berryman, Joel Sadler, Daniel Graham

专题命中 规划决策 :agentic(title,summary_cn)

AI总结 该研究提出由小型语言模型(SLM)驱动的智能体远程访问木马(agentic RAT),经实验验证其架构可行,虽操作可靠性不足,但预示着AI驱动自主网络威胁的近现实风险。

Comments 6 pages, 5 figures, 1 table. Formatted in Springer LNCS style

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02764 2026-08-05 cs.MA cs.DB 新提交 87%

Stateful Governance for Concurrent Agentic Systems

并发智能体系统的有状态治理

Yuxiang Peng, Xiaodi Wu

专题命中 规划决策 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文针对并发智能体系统的有状态治理问题,提出Provenact运行时架构,可防止失效授权,在采购工作流中避免策略违规,为智能体框架的有状态治理提供了可行路径。

Comments 18 pages, 8 figures. Revision notes: system terminology updated; technical content and results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 85%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 规划决策 :planning(title,abstract);tool-use(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03034 2026-08-05 cs.RO cs.AI 新提交 83%

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

PACE:面向时间高效具身规划的自适应预算分配

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 PACE框架通过交错式思考-执行架构和动态预算分配器,在Robotouille基准测试中较ReAct+Think基线提升规划成功率,同时大幅减少推理时间,实现具身规划的时间效率与质量同步提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-05 cs.AI cs.LG cs.MA 新提交 82%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03924 2026-08-05 cs.RO 新提交 82%

ETA: A New Agentic Paradigm for Embodied Tasks

ETA:一种用于具身任务的新型智能体范式

Yitong Chen, Zezheng Huai, Sixian Li, Yubang Wang, Haozhe Zhang, Yifei Zhang, Hechang Chen, Jingjing Gong, Yu-Gang Jiang, Xipeng Qiu

专题命中 规划决策 :agentic(title);agent(abstract,abstract_cn)

AI总结 针对当前具身系统泛化依赖训练数据、长时执行难控的问题,提出新型具身任务智能体范式ETA,发布开源实现OpenETA,为Codex提供轻量级插件以支持具身任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03223 2026-08-05 cs.LG cs.AI cs.CL 新提交 82%

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

具有自提炼奖励塑造的智能体强化学习

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang

专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。

Comments 17 pages,10 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03958 2026-08-05 cs.AI 新提交 81%

A game theory for foundation models shows new paths to rational cooperation through similarity inference

基础模型的博弈论:通过相似性推理实现理性合作的新路径

Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

专题命中 规划决策 :agent(abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)

AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。

Comments 75 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03086 2026-08-05 eess.IV cs.LG 新提交 79%

Automatic Patient-Specific Microwave Ablation Planning Accelerated by a Physics-Guided Deep Learning Model

基于物理引导深度学习模型加速的患者特异性微波消融自动规划

Seonaeng Cho, Minjee Seo, Minju Seol, Juil Park, Joon Ho Kwon, Kyungho Yoon

专题命中 规划决策 :planning(title,abstract);分类 cs.LG

AI总结 该研究提出结合神经消融预测模型与遗传算法的数字孪生框架,可快速实现患者特异性微波消融自动规划,提升消融效率、减少器官损伤且规划速度快约420倍

Comments Accepted at the Digital Twin for Healthcare (DT4H 2026) workshop at MICCAI 2026; 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03784 2026-08-05 cs.CE 新提交 78%

Empirical behavioural heterogeneity shapes the dynamics of an agent-based land use model

经验行为异质性塑造基于智能体的土地利用模型的动态特征

Ronja Hotz, Thomas Schmitt, Calum Brown, Yongchao Zeng, Mark Rounsevell

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究将欧洲林业从业者的经验行为类型学整合进基于智能体的土地利用模型,发现行为异质性可削弱土地利用的同步响应,提升模型真实性,且个体决策行为依赖所处种群环境。

Comments 30 pages, 24 figures. Submitted to SESMO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03408 2026-08-05 cs.RO cs.DC 新提交 78%

Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration

飞越不确定性自然(FORTUNE):面向低空协同的智能且人文的三维路径规划

Minghui Liwang, Wenhan Jia, Xinlei Yi, Wenbo Zhu, Yuhan Su, Xianbin Wang

专题命中 规划决策 :planning(title,abstract)

AI总结 本文针对低空智能体的三维多无人机路径规划问题,提出FORTUNE分层离线-在线框架,其在真实与合成场景中性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03882 2026-08-05 cs.CL cs.AI cs.IR 新提交 73%

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana

专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03138 2026-08-05 cs.CL cs.AI 新提交 73%

Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning

通过结构感知策略学习内化学术写作工作流以生成引言

Meicong Zhang, Tiancheng Su, Jiahao Cheng, Guoxiu He, Xinqi Tao, Dejia Song

专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03606 2026-08-05 cs.AI cs.LG 新提交 66%

Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents

临床试验策略学习:面向决策智能体的离线策略训练

William Bolton, Philip Torr

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)

AI总结 本研究将肿瘤学临床开发建模为离线决策问题,构建时间数据集,对比4种离线目标与4种LLM智能体,发现奖励加权行为克隆表现最优,证明结构化离线学习可用于规划临床实验。

Comments Accepted for a spotlight at the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio) and as a poster at the ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning (DEMO). 15 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 62%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03087 2026-08-05 cs.LG cs.AI 新提交 62%

SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation

SynEnergy:面向合成能源数据生成的异常语义引导扩散模型

Lin Jiang, Dahai Yu, Ravikumar Gelli, Guang Wang

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SynEnergy,一种两阶段扩散框架,通过HG-ASL提取异常语义、AS-Diff生成数据,在四个真实能源数据集上较11种基线提升异常保留与下游质量,可扩展至城市级场景。

Comments 24 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02826 2026-08-05 quant-ph cs.AI cs.LG stat.ML 新提交 62%

Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model

生成模型下强化学习的改进量子算法

Joao F. Doriguello

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对两类马尔可夫决策过程,提出结合值迭代与量子子例程的新型量子强化学习算法,其查询复杂度优于现有成果,接近量子下界。

Comments 22 pages. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03114 2026-08-05 econ.TH cs.AI cs.CY 新提交 57%

Optimal Liability Design for Medical AI

医疗人工智能的最优责任设计

Rui Mao, Tingliang Huang, Houcai Shen

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文构建委托代理模型研究医疗AI的最优责任设计,发现不对称信息下最优责任为统一水平,AI准确度与最优责任呈非单调关系,信息不对称是双刃剑,透明度对各利益相关者影响不均。

详情

展开后加载摘要…

URL PDF HTML 收藏