arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-12 至 2026-08-12 共收录 124 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 10 篇

2608.10530 2026-08-12 cs.CR cs.AI 新提交 85%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 工具调用 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 84%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 工具调用 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10042 2026-08-12 cs.LG cs.AI 新提交 84%

UserToolBench: A User-Profile-Hidden Benchmark for Personalized Decision Making in Tool-Use LLMs

UserToolBench:用于工具使用类大语言模型个性化决策的用户画像隐藏型基准测试集

Xuexiong Yin, Zechuan Chen, Yongsen Zheng, Yuxiang Zhang, Jingyuan Yang, Bin Wang, Yubin Wang, Keze Wang

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 UserToolBench是针对工具使用类大语言模型的基准测试集,可评估模型从交互历史推断用户偏好等个性化决策能力,实验发现当前模型在多工具协调等方面仍存瓶颈。

Comments 21pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10039 2026-08-12 cs.LG 新提交 83%

FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

FlowScout:从执行反馈到可靠的工具使用智能体工作流

Shuo Hao, You Lu, Bihuan Chen, Xin Peng

专题命中 工具调用 :agent(title);workflow(abstract);agentic(abstract);分类 cs.LG

AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10424 2026-08-12 cs.AI cs.LG 新提交 73%

Recovering Wasted Compute in Autoresearch Agents

恢复自动研究智能体中浪费的计算资源

Au Kwok Chun, Abhigyan Acherjee, Amrutha Rao, Zaiqian Chen, Kazem Meidani, C. Bayan Bruss, Micah Goldblum

机构 * Columbia University(哥伦比亚大学) Georgetown University(乔治城大学) Capital One(第一资本金融公司)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文针对自动研究智能体应用于表格数据集时的四类计算资源浪费问题,提出针对性干预措施,仅通过优化智能体设计即可大幅提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10037 2026-08-12 cs.LG cs.AI 新提交 73%

DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架

You Lu, Kun Zhang, Bihuan Chen, Xin Peng

专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10743 2026-08-12 cs.CL 新提交 70%

Mitigating Context Interference for Reliable and Efficient Search Agents

缓解可靠高效搜索智能体的上下文干扰

Boyang Xue, Bin Wu, Shuofei Qiao, Sheng Wang, Rui Wang, Yiming Du, Hongru Wang, Jeff Z. Pan, Emine Yilmaz, Kam-Fai Wong, Aldo Lipani

机构 * The Chinese University of Hong Kong(香港中文大学) University College London(伦敦大学学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 本文针对多轮搜索智能体的上下文干扰问题,提出基于蒸馏的上下文优化器,将其纳入RL训练后可显著提升搜索智能体的可靠性与效率,开创了AI智能体“先优化上下文再生成”的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10245 2026-08-12 cs.NE cs.LG 新提交 57%

A Graph Neural Network--Guided Genetic Algorithm for Physical Internet Supply Chain Optimization under Cost Uncertainty

成本不确定性下面向物理互联网供应链优化的图神经网络引导遗传算法

Faezeh Ardali, Gerald M. Knapp

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 针对成本不确定的物理互联网三级供应链优化问题,构建确定性与最小最大遗憾模型,提出GNN-GA算法,实验显示其在多实例上优于标准GA,学习到的初始化是主要改进来源。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09993 2026-08-12 eess.IV cs.CV 新提交 50%

APCReg: Anatomical-Prior-Guided Coarse-to-Fine CBCT--IOS Registration via Multi-View Projection and Reliability-Controlled Residual Correction

APCReg:基于解剖先验的、经多视图投影与可靠性控制残差校正的CBCT与口腔内扫描(IOS)粗到精配准方法

Xincan Zheng, Yaqi Wang, Zhi Li, Jiahao Bao, Lan Feng, Yiru Xia, Shuai Wang

专题命中 工具调用 :planning(abstract)

AI总结 针对CBCT与IOS自动配准不可靠的问题,提出APCReg框架,通过多视图解剖粗配准、重叠感知残差配准及牙弓结构假设选择等技术,在60个颌骨对的评估中多项指标优于开源基线。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10281 2026-08-12 cs.CR 新提交 50%

From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

从提示注入到Web漏洞利用:重新审视集成大语言模型的应用中的经典漏洞

Spiros Tsigkopoulos, Christoforos Ntantogian

专题命中 工具调用 :agentic(abstract)

AI总结 本文研究集成大语言模型的Web应用的新型攻击LLM介导的Web攻击,提出LLM2X系列攻击类型,通过实现TicketOracle实验发现模型易感性差异,给出多层缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 33 篇

2608.10357 2026-08-12 cs.LG cs.AI 新提交 88%

Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks

面向长周期工具使用智能体任务的高效强化学习

Zelei Cheng, Amritansh Mishra, Sambit Sahu, William Campbell

机构 * Capital One(第一资本金融公司) AI Foundations(人工智能基础部门)

专题命中 规划决策 :tool-use(title,abstract);agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 SINKFLEX-RL 模块化训练系统,通过整合环境接口等技术,在 Tau2Bench 测试中提升验证奖励并降低注意力路径显存占用,实现长周期工具使用智能体的高效 RL 训练。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-12 cs.AI 新提交 88%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 规划决策 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 25 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10157 2026-08-12 cs.AI 新提交 85%

SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents

SBCO:面向规划智能体的自监督、验证器驱动的工具链优化器

Vivek Kulkarni, Sudipta Paul, Aounon Kumar, Nicholas Tzou, Srinivas Chappidi

专题命中 规划决策 :planning(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究针对规划任务提出SBCO,一种自监督的验证器驱动工具链优化器,其性能优于或相当的定制基线,且计算成本仅为其1/4至1/5.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 84%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10108 2026-08-12 cs.AI 新提交 79%

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA:面向长视野智能体记忆的任务自适应多结构证据选择

Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 MESA是面向长视野智能体记忆的多结构证据选择框架,通过自适应选择融合互补记忆结构,在AMA-Bench上性能优于基线且减少了证据标记使用量。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10366 2026-08-12 cs.AI cs.CL 新提交 79%

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 规划决策 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11175 2026-08-12 cs.RO cs.SY eess.SY 新提交 78%

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments

行星环境安全导航下考虑不确定性的风险感知动力学运动规划

Sachin Sunil Kelkar, Tanmay Dokania, Yashwanth Kumar Nakka

机构 * Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 针对自主空间探索中环境交互与感知系统的不确定性导致的安全规划问题,提出结合AO-RRT采样规划与序列凸规划的风险感知动力学运动规划方法,可将轨迹风险降低约97%。

Comments 3 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 78%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 规划决策 :agent(title,abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10220 2026-08-12 cs.RO 新提交 78%

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

人形机器人在受限空间中通过自碰撞规避实现全身规划的参考方案

Carlos Gonzalez, Luis Sentis

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出三阶段全身规划框架,结合可微分自碰撞规避与可达性约束,在Unitree G1人形机器人上实现Cr<1.5的受限空间导航,生成复杂接触轨迹并训练出鲁棒在线跟踪策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10990 2026-08-12 math.AT 新提交 78%

On the Sequential topological complexity of directed (parametrized) motion planning algorithms

关于定向(参数化)运动规划算法的序列拓扑复杂性

Navnath Daundkar, Abhishek Sarkar, Ankur Sarkar

专题命中 规划决策 :planning(title,abstract)

AI总结 该研究引入定向(参数化)拓扑复杂性的序列类似物,构建其基础理论并确立基本性质,计算发现同一基础空间上不同定向结构的该不变量取值不同。

Comments 23 pages. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10309 2026-08-12 physics.flu-dyn cs.RO 新提交 78%

Wind-Informed Rapid Flight-Planning in Complex Urban Topologies via Machine Learning and Experimental Validation

基于机器学习与实验验证的复杂城市拓扑下风感知快速飞行规划

Peter I. Renn, Alejandro A. Stefan-Zavala, Julian Humml, Sabera Talukder, Aysha AlMazrouei, Kresna Aji, Debashisha Mishra, Emanuele Panizio, Jennifer Simonjan, Yisong Yue, Morteza Gharib

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究提出一种新型风感知飞行规划框架,通过学习代理模型快速预测城市流场,经风洞实验验证可减少飞行器非期望位移、提升稳定性,为先进空中机动提供安全方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09975 2026-08-12 physics.ao-ph 新提交 78%

A black-box-model-enhanced interaction method for water-wave scattering by large group of arbitrary-shaped ice floes in Arctic route planning

北极航线规划中大量任意形状浮冰水波散射的黑箱模型增强交互方法

Chongwei Zhang, Hongli Yang, Peng Wu, Peng Lu, Dezhi Ning

专题命中 规划决策 :planning(title,abstract)

AI总结 本研究提出WCD黑箱模型构建DTM,开发EI方法高效预测北极航线中大量任意形状浮冰的水波场,结合动态规划优化航线,可使船舶平均波幅降至入射波幅约一半,计算效率极高。

Comments 31 pages, 37 figures; submitted to Cold Regions Science and Technology on March 22, 2025; received first revision request on March 18, 2026; submitted first revision on April 7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10494 2026-08-12 cs.AI cs.MA 新提交 77%

GeoForge: Non-Parametric Self-Evolving Agents for Earth-Observation Reasoning

GeoForge:用于对地观测推理的非参数自进化智能体

Xin Xiao, Jiang Zhong, Junnan Zhu, Yingchao Feng, Peijin Wang, Yidan Zhang, Kaiwen Wei

专题命中 规划决策 :tool-use(abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交 74%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 规划决策 :agentic(title);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10337 2026-08-12 cs.HC cs.AI cs.CL 新提交 62%

Narrative Keyframing for Generative Creative Writing

用于生成式创意写作的叙事关键帧技术

Chao Zhang, Abe Davis

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出叙事关键帧技术,作为AI辅助创意写作的交互方法,通过三种关键帧类型实现对生成文本的精细控制,经用户研究验证其可控性、透明性与趣味性更优。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11152 2026-08-12 cs.DC cs.LG 新提交 57%

Scheduling Mixed RL Rollouts Beyond Prefix Locality

超越前缀局部性的混合强化学习回滚调度

Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen Tian

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11083 2026-08-12 cs.NI cs.LG 新提交 57%

A Systematic Sample Size Analysis of ML-Based Path Loss Prediction for LPWAN

面向低功耗广域网(LPWAN)的基于机器学习的路径损耗预测的系统样本量分析

Robert Bitterling, Christian Nettersheim, Jörn Hees, Michael Rademacher

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对LPWAN的路径损耗预测,采用结合LiDAR地形特征的随机森林与坐标数据的k近邻,发现两种机器学习模型在不同训练规模下均优于基线模型,且留一网关验证显示随机森林迁移性能更优。

Comments Accepted at IEEE Conference on Local Computer Networks (LCN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10976 2026-08-12 cs.AI 新提交 57%

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链

Foundation Model Team, XPeng Inc

机构 * XPeng Inc(小鹏汽车)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10664 2026-08-12 cs.AI 新提交 57%

Operationalising Relative Causal Knowledge: Backbone Identifiability from Private Reports on a Shared Outcome

相对因果知识的可操作化:基于共享结果的私人报告的主干可识别性

Fabrizio Russo, Mark Somers

机构 * Imperial College London(帝国理工学院) Fifty One Degrees Ltd(51度公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文研究相对因果知识的主干可识别性,针对双智能体共同效应案例,明确局部因果边际无法唯一确定主干,提出需智能体传递因果识别的响应函数方可实现识别,以教育增值示例说明其兼具通信与政策组合属性。

Comments Accepted at Causal Decision Making Workshop, UAI2026. 4 pages + Appendix (13 total)

详情

展开后加载摘要…

URL PDF HTML 收藏