arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-13 至 2026-05-13 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 16 篇

2605.12131 2026-05-13 cs.AI 89%

Rollout Cards: A Reproducibility Standard for Agent Research

Rollout Cards: 代理研究的可重复性标准

Charlie Masters, Ziyuan Liu, Stefano V. Albrecht

机构 * Deepflow Nanyang Technological University(南洋理工大学)

专题命中 工具调用 :agent(title,abstract);tool use(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出Rollout Cards作为代理研究的可重复性标准,通过保留rollout记录并声明报告规则,解决评估结果不可复现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 85%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 工具调用 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11928 2026-05-13 cs.AI 83%

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12497 2026-05-13 cs.CV 82%

From Web to Pixels: Bringing Agentic Search into Visual Perception

从网络到像素:将代理搜索引入视觉感知

Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

机构 * Deep Research

专题命中 工具调用 :agentic(title,abstract);workflow(abstract)

AI总结 本文提出感知深度研究,引入WebEye基准,通过代理搜索到像素的工作流程,解决隐藏目标身份并绑定到框、掩码或 grounded 答案,实验显示其在三个任务视图中表现最佳。

Comments Project page: https://pixel-searcher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 工具调用 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 79%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17265 2026-05-13 cs.IR 78%

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search

MemSearch-o1:通过基于推理的内存增长增强大语言模型的代理搜索

Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 工具调用 :agentic(title,abstract)

AI总结 MemSearch-o1通过基于推理的内存增长和回溯机制,解决代理搜索中的内存稀释问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11781 2026-05-13 cs.CR 78%

Five Attacks on x402 Agentic Payment Protocol

对x402代理支付协议的五种攻击

Zelin Li, Qin Wang, Zhipeng Wang

专题命中 工具调用 :agentic(title);workflow(abstract)

AI总结 本文分析x402协议,发现其在设计和实现中存在漏洞,提出五种攻击揭示授权、绑定、重放保护及Web层处理中的弱点,通过测试环境和审计验证攻击可行性,并提出缓解措施。

Comments 17 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09287 2026-05-13 cs.AI 74%

PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning

PiCA:基于枢纽的搜索代理强化学习中的信用分配

Dongyi Liu, Yifan Niu, Qinwen Wang, Han Xiao, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 工具调用 :agentic(title);分类 cs.AI

AI总结 PiCA通过重新定义搜索轨迹为累积搜索进度的序列过程,解决长周期信用分配中的稀疏奖励、孤立信用和分布偏移问题,提升知识密集型问答任务性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI 57%

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17637 2026-05-13 cs.AI cs.FL cs.LO 57%

About Time: Model-free Reinforcement Learning with Timed Reward Machines

关于时间:无模型强化学习中的定时奖励机

Rajarshi Roy, Anirban Majumdar, Ritam Raha, David Parker, Marta Kwiatkowska

机构 * University of Liverpool(利物浦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文提出定时奖励机(TRMs)以解决传统奖励机在时间约束建模上的不足,通过无模型强化学习框架学习满足时间约束的最优策略,并在实验中验证其有效性。

Comments Extended version of paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11324 2026-05-13 cs.LG stat.ML 57%

$\varepsilon$-Good Action Identification in Fixed-Budget Monte Carlo Tree Search

固定预算蒙特卡洛树搜索中的ε-好动作识别

Yinan Li, Tuan Nguyen, Kwang-Sung Jun

机构 * Department of Computer Science(计算机科学系) University of Arizona(亚利桑那大学) CSE/GSAI POSTECH(POSTECH CSE/GSAI)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 本文研究了深度为2的max-min树中的固定预算max-min动作识别问题,提出了一种无需输入ε的算法,实现了实例依赖的误差界,并给出了max-min识别的下界结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11259 2026-05-13 cs.AI 57%

Template-as-Ontology: Configurable Synthetic Data Infrastructure for Cross-Domain Manufacturing AI Validation

模板作为本体:用于跨领域制造人工智能验证的可配置合成数据基础设施

Grama Chethan

机构 * Siemens Digital Industries Software(西门子数字工业软件)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 本文提出一种模板作为本体的方法,通过单一Python配置模块生成制造仿真和AI分析工具的统一数据结构,验证了跨领域制造AI验证的可行性。

Comments 18 pages, 1 fugure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10125 2026-05-13 cs.AI cs.HC 57%

Useful for Exploration, Risky for Precision: Evaluating AI Tools in Academic Research

对探索有用,对精确性危险:评估学术研究中的AI工具

Anthea Dathe, Kiran Hoffmann, Aline Mangold

机构 * Dresden University of Technology(德累斯顿技术大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文评估了AI工具在学术研究中的应用,指出尽管AI工具能提升效率,但其输出难以验证且易出错,需结合人本与计算机指标进行评估,发现问答工具虽能提供概述但不适用于精确信息提取,文献综述工具则缺乏可复现性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12449 2026-05-13 cs.CV 50%

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

LychSim:一种可控且交互式的视觉研究仿真框架

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 工具调用 :agentic(abstract)

AI总结 LychSim基于Unreal Engine 5构建,提供简洁的Python API、生成多样化高保真环境的流程数据管道以及MCP协议集成,用于视觉研究中的可控仿真与闭环优化。

Comments 3D-LLM/VLA Workshop at CVPR 2026. Project page: https://lychsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21887 2026-05-13 cs.RO 50%

IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments

IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合

Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang

机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)

专题命中 工具调用 :planning(abstract)

AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏