arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-05 至 2026-08-05 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 23 篇

2602.13769 2026-08-05 cs.AI cs.CE cs.NE 版本更新 92%

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 工具调用 :agent(title,title_cn);planning(abstract);workflow(abstract);multi-agent(abstract)

AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02650 2026-08-05 cs.AI cs.SE 新提交 90%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 工具调用 :tool-use(title,abstract);planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20244 2026-08-05 cs.LO cs.AI cs.CL cs.LG cs.SE 版本更新 83%

Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search

Lean Refactor: 通过代理策略搜索实现多目标可控的证明优化

Jialin Lu, Soonho Kong, Rodrigo Stehling, Kaiyu Yang, Zhangyang Wang, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙弗雷泽大学) Amazon Web Services(亚马逊网络服务) MiroMind University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Lean Refactor框架,通过检索增强的代理策略搜索,解决多目标、可控和版本鲁棒的Lean证明重构问题,主要贡献是通过预注释的多目标重构策略数据库实现高效的证明优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05159 2026-08-05 cs.CR cs.AI cs.LG 版本更新 82%

Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain

Agentland中的恶意行为:深入AI供应链后门问题

Léo Boisvert, Abhay Puri, Chandra Kiran Reddy Evuru, Nazanin Sepahvand, Nicolas Chapados, Quentin Cappart, Jason Stanley, Alexandre Lacoste, Krishnamurthy Dj Dvijotham, Alexandre Drouin

机构 * ServiceNow Research Mila - Qu\'ebec AI Institute

专题命中 工具调用 :agent(abstract);AI agent(abstract);tool use(abstract);agentic(abstract)

AI总结 研究探讨了在交互数据上微调AI代理时引入的安全漏洞,提出三种供应链威胁模型,证明通过污染少量演示即可使代理泄露用户信息。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02611 2026-08-05 cs.DC cs.AI cs.LG cs.SE 新提交 82%

KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization

KernelBrain:面向智能体的GPU内核优化的粗到细、预算感知搜索

Shuai Che, Gang Peng

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 KernelBrain是结合LLM引导变异等技术的GPU内核优化智能体,可提升内核质量与搜索效率,在Triton内核任务中获多倍加速且缩短优化时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 81%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 工具调用 :agentic(abstract,abstract_cn);tool use(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 81%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03222 2026-08-05 cs.SE cs.AI 新提交 81%

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启

Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

专题命中 工具调用 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02645 2026-08-05 cs.SE cs.AI 新提交 81%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03403 2026-08-05 cs.AI 新提交 79%

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

通过经验驱动的自适应指导实现智能体的鲁棒工具使用

Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

专题命中 工具调用 :tool use(title,abstract);分类 cs.AI

AI总结 本研究针对智能体工具使用鲁棒性不足的问题,提出ExpG机制,经实验验证其可提升多类工具任务性能,还能让小模型智能体超越未用该机制的大模型智能体。

Comments Preprint.14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 79%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 工具调用 :tool use(title,abstract);分类 cs.SE

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02698 2026-08-05 cs.CR cs.AI 新提交 79%

Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach

使用工具的智能体群体中自适应隐式合谋的隐写分析:一种黑盒跨主体方法

Mohamed Chahine Ghanem

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对使用工具的LLM智能体群体的自适应隐式合谋,构建结合多类方法的黑盒隐写分析检测器,开展红蓝对抗实验,绘制检测容量边界并发现新的规避手段。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03741 2026-08-05 cs.DC 新提交 78%

When Does Disaggregation Pay? Simulating Prefill--Decode--Attention--FFN Specialization for Agentic LLM Inference

拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟

Przemyslaw Forys, Haoran Wu, Can Xiao, Jiayi Nie, Tony Liu, Rika Antonova, Timothy Jones, Robert Mullins, Wayne Luk, Aaron Zhao, George A. Constantinides

专题命中 工具调用 :agentic(title,abstract)

AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14636 2026-08-05 cs.LG cs.AI 版本更新 62%

When Search Teaches Style: Causal Internalization of Tactical Priors in AlphaZero

AlphaZero-Edu:普及AlphaZero的访问

Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang

机构 * Department of Communication Studies, School of Communication, Hong Kong Baptist University(通讯学院传播研究系,香港 Baptist 大学) Department of Neurobiology and Department of Rehabilitation Medicine, First Affiliated Hospital, Zhejiang University School of Medicine(神经生物学系和康复医学系,浙江大学医学院第一附属医院) Personal participation(个人参与)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AlphaZero-Edu,一种轻量级教育导向的实现,通过模块化架构和高效训练,提升AlphaZero的可访问性和可重复性,实现单GPU训练和并行自对弈加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 62%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11482 2026-08-05 cs.AI cs.CL 62%

Meta Prompting for AI Systems

为AI系统引入元提示

Yifan Zhang, Yang Yuan, Andrew Chi-Chih Yao

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。

Comments Project Page: https://github.com/meta-prompting/meta-prompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03071 2026-08-05 cs.AI 新提交 57%

Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls

参数优化:面向大语言模型工具调用的难度分级基准与探测引导训练

Guoyao Yu, Xiaoqing Sun, Ziqi Huang, Shaojing Fan, Zhongyi Zhang, Xiaomeng Hu, Xiaobo Xue, Yangyang Shi, Xiong Xiao, Yang Song, Biao Lyu, Rong Wen, Xing Li, Qinming He, Shunming Zhu, Zhenguang Liu

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 针对大语言模型工具调用参数填写关注度不足的问题,提出含PBT和PGR的探测引导框架,发布ParamBench基准,使5个开放模型在多基准上的参数生成平均精确匹配率从19.7%升至59.6%。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01867 2026-08-05 cs.CL 版本更新 57%

CRISP: Critical Step Perception for Training Efficient Deep Search Agents

CRISP:用于训练高效深度搜索智能体的关键步骤感知

Haosi Mo, Zihao Yan, Ruiqing Zhang, Zhongli Li, Hexuan Deng, Xuebo Liu, Min Zhang

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00238 2026-08-05 cs.GR cs.LG 版本更新 57%

Robust Biharmonic Skinning Using Geometric Fields

基于几何场的鲁棒双调和蒙皮技术

Ana Dodik, Vincent Sitzmann, Justin Solomon, Oded Stein

专题命中 工具调用 :tool use(abstract);分类 cs.LG

AI总结 本文提出一种基于几何场的无网格鲁棒自动蒙皮技术,借助硬件光线追踪实现的拉格朗日表示优化双调和能量,可在开放曲面等现有方法失效的场景生成与最优方法相当的权重,经全面评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02564 2026-08-05 cs.DS 版本更新 50%

Pairwise-Independent Dithering for Single-Stage Hadamard Quantization

用于单阶段哈达玛量化的两两独立抖动

Honghao Lin, Vahab Mirrokni, David P. Woodruff

专题命中 工具调用 :agentic(abstract)

AI总结 针对高维向量量化的两阶段哈达玛量化方法存在通信开销大、主导常数高的问题,提出了基于两两独立抖动的单阶段哈达玛量化方法,消除了残差阶段,降低了约5.93倍的主导常数,相关证明由谷歌Gemini智能体系统完成并验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01631 2026-08-05 cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

First-principles screening of materials with extreme effective masses

基于极端有效质量的材料原理计算筛选

Szymon Błazucki, Junfeng Qiao, Aleksandr Poliukhin, Nicola Marzari

专题命中 工具调用 :workflow(abstract)

AI总结 本研究通过原理计算筛选出具有极端有效质量的材料,揭示了电子和空穴的导电有效质量张量,并探讨了材料在窄带隙区域的物理极限。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19192 2026-08-05 cs.DC 版本更新 50%

MUSE: A Heterogeneity-Aware Multimedia Search Engine for Mobile SoCs

AME:一种高效的异构代理记忆引擎用于智能手机

Xinkui Zhao, Qingyu Ma, Yifan Zhang, Hengxuan Lou, Sai Liu, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

专题命中 工具调用 :AI agent(abstract)

AI总结 AME是一种为智能手机设计的高效异构代理记忆引擎,通过硬件感知的矩阵流水线和调度方案提升内存处理效率,实现更高吞吐量和更低延迟。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏