arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 15 篇

2605.28071 2026-05-28 cs.CR 88%

AgentGuard: An Attribute-Based Access Control Framework for Tool-Use LLM-Based Agent

AgentGuard:面向工具使用型LLM智能体的基于属性的访问控制框架

Jiaqi Luo, Songyang Peng, Jiarun Dai, Zhile Chen, Zhuoxiang Shen, Geng Hong, Xudong Pan, Yuan Zhang, Min Yang

专题命中 工具调用 :agent(title,abstract);tool-use(title,abstract)

AI总结 提出AgentGuard框架,通过客户端-服务器架构和三种互补检查机制,为工具使用型LLM智能体提供轻量级集成与跨工具安全风险防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28480 2026-05-28 eess.AS cs.SD 87%

Audio-Mind: An Auditable Agentic Framework for Audio Understanding

Audio-Mind: 一种可审计的音频理解智能体框架

Yucheng Wang, Jing Peng, Hanqi Li, Chenghao Wang, Wenming Tu, Yu Xi, Zhaokai Sun, Kai Yu, Shuai Wang

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) Department of Computer Science, ETH Zürich, Switzerland(苏黎世联邦理工学院计算机科学系) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院X-LANCE实验室) School of Automation Science and Engineering, Xi’an Jiaotong University, China(西安交通大学自动化科学与工程学院) School of Computer Science, Northwestern Polytechnical University, China(西北工业大学计算机科学学院)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 提出Audio-Mind框架,通过条件性证据获取动态结合强前端与规划器引导的工具使用,解决音频理解中智能体证据获取的时机问题,在MMAR和MSU-Bench上分别达到80.4%和82.8%的准确率,并生成可审计的推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09572 2026-05-28 cs.AI cs.LG cs.SE 85%

SynthTools: A Framework for Scaling Synthetic Tools for Agent Development

SynthTools: 用于扩展智能体开发中合成工具的框架

Tommaso Castellani, Naimeng Ye, Daksh Mittal, Thomson Yen, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

专题命中 工具调用 :agent(title);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出基于LLM的端到端管道SynthTools,通过环境生成、模拟、验证和任务构建,生成大规模多样化工具使用环境,提升智能体工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27485 2026-05-28 cs.LO cs.LG cs.SE 84%

Automating Formal Verification with Agent-Guided Tree Search

利用智能体引导的树搜索自动化形式验证

Leo Yao

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 工具调用 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出智能体引导的树搜索方法,通过状态和上下文两种编排器改进基于大语言模型的Lean形式验证代码生成性能,在基准测试中达到95.0%的通过率。

Comments 78 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27788 2026-05-28 cs.LG cs.CL 81%

Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use

知道何时求助:面向LLM工具使用的片段级信用分配

Abhijit Kumar, Zoey Wu, Mohit Suley

机构 * Microsoft AI Redmond(微软AI红mond)

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.CL、cs.LG

AI总结 提出CARL方法,通过强化学习在模型自身轨迹上训练评论家,对每个工具使用片段独立分配信用,使模型学会区分参数知识足够与需要外部帮助的情况,在多个基准上提升准确率并减少不必要的工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28224 2026-05-28 cs.AI 79%

When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?

何时记忆有助于工具使用LLM代理的多轨迹推理?

Xinzhe Li, Yaguang Tao

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 工具调用 :tool-use(title,abstract);分类 cs.AI

AI总结 本文提出一个统一框架,将记忆沿传输范围和内容抽象两个维度分解,在无验证器设置下评估四种记忆方法与三种推理策略在四个工具使用基准上的表现,发现推理策略是混淆变量,不同策略下相同记忆方法产生显著不同结果。

Comments More evaluation and analysis are on the way

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28000 2026-05-28 cs.SE cs.AI 76%

Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution

Tool Forge:一种用于受控代理执行的携带验证的工具链

Swanand Rao

机构 * Next Moca Global, Inc.(Next Moca全球公司)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出 Tool Forge,一种将自然语言能力意图转换为经过验证、沙盒验证、编目工具制品,并通过令牌高效路由层暴露给代理的工具链,解决了代理执行中工具层缺乏治理和验证的问题。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/nextmoca/tool-forge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28146 2026-05-28 cs.CR 67%

Cybersecurity AI (CAI) Dataset

网络安全AI(CAI)数据集

Víctor Mayoral-Vilches

专题命中 工具调用 :agent(abstract);AI agent(abstract)

AI总结 提出CAI数据集,一个包含十四个月网络安全LLM轨迹的大规模语料库,旨在解决专家操作轨迹是LLM性能瓶颈的问题,并揭示了集中化API提供商带来的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28814 2026-05-28 cs.CL 57%

Self-Improving Language Models with Bidirectional Evolutionary Search

具有双向进化搜索的自我改进语言模型

Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham M. Kakade, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 工具调用 :agentic(abstract);分类 cs.CL

AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28354 2026-05-28 cs.AI 57%

Plan Before Search: Search Agents Need Plan

搜索前先规划:搜索智能体需要规划

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Jiayi Ji, Chenyi Lei, Wenwu Ou, Xiaoshuai Sun, Qibin Hou

机构 * Kuaishou Technology(快手科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) VCIP, CS, Nankai University(南开大学VCIP实验室)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 提出Plan方法,通过将问题分解为有序子问题再进行检索,并引入自举训练范式,无需外部强模型蒸馏即可在多跳QA中激活规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28168 2026-05-28 cs.AI 57%

OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings

OccuReward: 面向电网交互建筑中人口公平性的LLM引导的以 occupant 为中心的奖励塑造

Shadmehr Zaregarizi, Khashayar Yavari

机构 * Politecnico di Torino(都灵理工大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出OccuReward框架,利用大语言模型迭代塑造奖励函数,通过舒适公平指数(CEI)反馈,在CityLearn v2中提升不同人口群体的舒适公平性,同时降低能耗成本。

Comments 4 pages, 2 figures. Accepted at OccuSys 2026, co-located with ACM Sustainability Week 2026. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27716 2026-05-28 cs.SE 57%

LLM Based Web Accessibility Repair: An Empirical Study of Detection, Remediation, and Cost

基于LLM的网页可访问性修复:检测、修复与成本的实证研究

Oluwatoyosi Oyelayo, Ghada Abushaqra, Parham Asadi, Durjoy Dey, Diego Elias Costa

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 本文通过实证研究评估基于大语言模型的智能体(Kimi K2.5)在网页可访问性自动检测与修复中的性能,发现其检测能力与规则工具相当但可靠性不足,修复在语法有效性上表现优异但完全修复率低,且迭代优化增加成本而无益,提出混合方法的需求。

Comments 12 pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27610 2026-05-28 cs.IR cs.AI cs.HC 57%

Eliot: Interactively $\underline{E}$xploring Fast-Changing Scientific $\underline{Li}$terature Trends with $\underline{O}$nline Da$\underline{t}$a and Learning

Eliot: 通过在线数据和学习交互式探索快速变化的科学文献趋势

Bernardo A. Denkvitts, Nitin Gupta, Biplav Srivastava

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出Eliot系统,通过查询时聚类和时间可视化,帮助研究人员可追溯地探索快速变化的科学文献趋势。

Comments Under-review at CIKM Applied Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12586 2026-05-28 cs.AI 57%

Can I Have Your Order? Monte-Carlo Tree Search for Slot Filling Ordering in Diffusion Language Models

能给我你的订单吗?扩散语言模型中插槽填充顺序的蒙特卡洛树搜索

Joshua Ong Jun Leang, Yu Zhao, Mihaela Cătălina Stoian, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

机构 * Imperial College London(帝国理工学院伦敦分校) University of Edinburgh(爱丁堡大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对掩码扩散模型(MDM)中计划-填充解码对插槽填充顺序敏感的问题,提出McDiffuSE框架,利用蒙特卡洛树搜索(MCTS)优化生成顺序,平均性能提升3.2%,在MBPP和MATH500上分别提升19.5%和4.9%。

Comments 8 pages, ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28562 2026-05-28 econ.TH 50%

Two Equivalence Results between Unemployment Insurance and Wage Insurance

失业保险与工资保险之间的两个等价结果

Anchi Xia

专题命中 工具调用 :agent(abstract)

AI总结 在风险中性的McCall模型中,证明事前意义上工资保险与失业保险的组合等价于依赖于上次就业工资的失业保险与依赖于当前就业工资的税收的组合,且工资保险仅在最后工资超过阈值时有效。

详情

展开后加载摘要…

URL PDF HTML 收藏