arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 18 篇

2606.05296 2026-06-05 cs.LG cs.AI 89%

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

智能体蒙特卡洛:黑盒智能体的强化学习模拟

Dae Yon Hwang, Raunaq Suri, Valentin Villecroze, Anthony L. Caterini, Jesse C. Cresswell, Noël Vouitsis, Brendan Leigh Ross

机构 * University of Cambridge(剑桥大学)

专题命中 工具调用 :agentic(title,summary_cn);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Monte Carlo (AMC)方法,利用序贯蒙特卡洛从最优策略后验中采样,无需参数级优化即可对黑盒LLM智能体进行强化学习式优化,在AgentGym基准上超越提示基线并随测试时计算扩展优于GRPO。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06054 2026-06-05 cs.AI 87%

Beyond Similarity: Trustworthy Memory Search for Personal AI Agents

超越相似性:面向个人AI代理的可信记忆搜索

Jiawen Zhang, Kejia Chen, Jiachen Ma, Yangfan Hu, Lipeng He, Yechao Zhang, Jian Liu, Xiaohu Yang, Tianwei Zhang, Ruoxi Jia

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 工具调用 :AI agent(title,abstract);agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05449 2026-06-05 cs.AI cs.GT econ.EM 83%

Insurance of Agentic AI

代理型人工智能的保险

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, New York University, Tandon School of Engineering(电气与计算机工程系,纽约大学,工程学院)

专题命中 工具调用 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文分析了代理型AI带来的新型风险,提出了承保、定价、再保险和产品设计的框架,并构建了整合多种保险覆盖的协调架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06140 2026-06-05 cs.CR 78%

RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing

RedEdit: 基于MCTS引导的照片编辑的图像安全分类器智能红队测试

Weilin Lin, Ziqi Lin, Zhenxing Zhou, Jianze Li, Tong Zhang, Hui Xiong, Li Liu

专题命中 工具调用 :agentic(title);agent(abstract)

AI总结 提出RedEdit,一种基于视觉语言模型提议和蒙特卡洛树搜索规划的黑盒红队代理,通过组合编辑工具序列使不安全图像逃避检测,平均不到两次编辑即可使76.2%的不安全图像绕过分类器,同时保留93.0%的恶意语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05728 2026-06-05 cs.AI cs.CL 76%

DiG-Plan: Mitigating Early Commitment for Tool-Graph Planning via Diffusion Guidance

DiG-Plan:通过扩散引导缓解工具图规划中的早期承诺问题

Yansi Li, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 工具调用 :planning(title);分类 cs.AI、cs.CL

AI总结 针对工具图规划中自回归解码的早期承诺问题,提出基于扩散生成器与自回归精炼器解耦的DiG-Plan框架,显著提升组合搜索覆盖率和任务性能。

Comments Accepted at IJCAI-ECAI 2026. This is an author preprint; the final version will appear in the IJCAI Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06387 2026-06-05 cs.CR 67%

WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents

WebMCP工具表面投毒:针对LLM智能体的运行时操纵攻击

Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

专题命中 工具调用 :agent(abstract);AI agent(abstract)

AI总结 本文提出一种新的威胁——会话中工具注入(MSTI),通过第三方脚本在活跃会话中注入恶意工具,并细分为工具劫持和工具框架两类,实验证明可破坏WebMCP功能,最后给出缓解方向和安全设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05186 2026-06-05 cs.LG cs.CL 62%

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

预算受限的微预训练中的分阶段因子筛选

Felipe Chavarro Polania

机构 * Hewlett Packard Enterprise(惠普企业)

专题命中 工具调用 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06284 2026-06-05 cs.AI 57%

ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents

ToolChoiceConfusion: 因果最小工具过滤实现可靠LLM智能体

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 提出因果最小工具过滤(CMTF)方法,通过因果充分性选择工具,减少错误工具调用和令牌成本,在102个任务、100个工具、4个LLM后端的基准测试中,将可见工具从100个减少到每步1个,令牌使用降低约90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05784 2026-06-05 cs.AI 57%

TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents

TAPO: 通过信用转移实现工具感知策略优化用于多模态搜索代理

Chengqi Dong, Chuhuai Yue, Hang He, yandong liu, Fenghe Tang, S Kevin Zhou, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 针对GRPO在多模态搜索代理中信用误分配问题,提出TAPO方法,利用工具参数确定性构建反事实证人进行保守优势校正,无需额外标注或采样,在多个基准上持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05559 2026-06-05 cs.LG 57%

CLaaS: Continual learning as a service for sample efficient online learning

CLaaS: 作为服务的持续学习,用于样本高效的在线学习

Kion Fallah, Silen Naihin, Barak Widawsky, Qingqing Mao

机构 * Resolute Labs(Resolute实验室) Incept Labs(Incept实验室)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 提出CLaaS系统,通过经验回放缓冲区实现异步训练中的梯度复用,在对抗性任务中展示参数更新优于上下文学习的前向迁移和遗忘减少。

Comments 4 pages main content, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05411 2026-06-05 cs.AI cs.HC 57%

A Motivational Architecture for Conversational AGI

对话式通用人工智能的动机架构

Anna Mikeda, Ben Goertzel

机构 * Glass Umbrella(玻璃伞) SingularityNet

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出一种对话式动机架构,将OpenPsi动机谱系重新解释为对话原生术语,并耦合MetaMo的高层动机支架,通过十阶段动机处理流水线、双决策策略以及行动前感受与行动后情绪的功能区分,实现对话智能体的能力调节、不确定性减少、亲和力等动机管理。

Comments 16 pages. Accepted for AGI-26 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05253 2026-06-05 cs.LG 57%

Alpha-RTL: Test-Time Training for RTL Hardware Optimization

Alpha-RTL: 面向RTL硬件优化的测试时训练

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院) University of the Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉学科学院)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 提出TTT-RTL框架,通过测试时强化学习结合EDA反馈(语法检查、仿真和PPA奖励)优化LLM生成的RTL设计,在RTLLM v2.0和工业级C910 FPU单元上分别降低PPA乘积65.1%和ADP 59.4%。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05104 2026-06-05 cs.AI 57%

Knowledge Index of Noah's Ark

诺亚方舟的知识索引

Sheng Jin, Minghao Liu, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan, Ge Zhang

机构 * M-A-P Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) Waseda University(早稻田大学) The University of Tokyo(东京大学) Massachusetts Institute of Technology(麻省理工学院) University of Arizona(亚利桑那大学) Northwestern University(西北大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 针对LLM知识基准的代表性、注释质量和排名稳定性问题,提出KINA基准,通过贪婪近似实现学科代表性,并证明奖金锦标赛机制优于固定支付,实验显示顶级模型性能远未饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23809 2026-06-05 eess.SY cs.LG cs.SY 57%

Advanced AI Service Provisioning in O-RAN through LLM Engine Integration

通过LLM引擎集成在O-RAN中的高级AI服务提供

Seyed Bagher Hashemi Natanzi, Pranshav Gajjar, Bo Tang, Vijay K. Shah

机构 * Department of Electrical and Computer Engineering, Worcester Polytechnic Institute(电气与计算机工程系,沃斯特理工学院) Department of Electrical and Computer Engineering, North Carolina State University(电气与计算机工程系,北卡罗来纳州立大学)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 提出一种双脑架构,结合LLM的推理能力和轻量级ML引擎的实时性,实现O-RAN中AI服务的自动化部署与配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06125 2026-06-05 cs.GT 50%

Regret Minimization in Single-Dimensional Contract-Design with Binary Actions

二元行动单维契约设计中的遗憾最小化

Riccardo Poiani, Martino Bernasconi, Andrea Celli

专题命中 工具调用 :agent(abstract)

AI总结 针对在线主-代理问题中代理类型对抗性序列,提出基于非均匀离散化的阈值优化方法,实现与结果数量无关的Θ(T^{2/3})遗憾界;对于固定隐藏类型,采用探索后提交策略达到Θ̃(√T)遗憾界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06106 2026-06-05 cs.IR 50%

WebKnoGraph: GNN-Powered Internal Linking

WebKnoGraph: 基于GNN的内部链接优化

Emilija Gjorgjevska, Georgina Mirceva, Miroslav Mirchev

专题命中 工具调用 :workflow(abstract)

AI总结 提出WebKnoGraph框架,利用GraphSAGE对网站爬取数据建模为有向图,通过PageRank和语义一致性评估自动与专家辅助链接选择策略,发现自动选择带来更强权威重分配但语义成本更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06063 2026-06-05 cs.DC 50%

LLM-Based Porting of Optimized C++ to CUDA Through Deoptimization and Reoptimization

基于LLM的通过去优化和再优化将优化C++移植到CUDA

Daichi Mukunoki, Ryo Mikasa, Shunichiro Hayashi, Tetsuya Hoshino, Takahiro Katagiri

专题命中 工具调用 :workflow(abstract)

AI总结 提出Deopt-Reopt工作流,通过先简化CPU优化代码再重新翻译优化为CUDA,利用LLM提升移植性能,实验表明该方法在部分内核上有效但非普遍适用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27489 2026-06-05 cs.CY 50%

Auditing LLM Editorial Bias in News Media Exposure

审查新闻媒体曝光中的LLM编辑偏见

Marco Minici, Cristian Consonni, Federico Cinus, Giuseppe Manco

专题命中 工具调用 :agentic(abstract)

AI总结 本文研究了LLM在新闻聚合中的编辑偏见问题,通过比较三种领先的LLM与Google News,发现LLM在媒体多样性、意识形态和可靠性方面存在显著差异。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏