arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-25 至 2026-05-25 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 22 篇

2605.11053 2026-05-25 cs.CR cs.AI cs.LG 88%

Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols

LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究

Sultan Zavrak

机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。

Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 81%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23899 2026-05-25 cs.AI 79%

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

从原始经验到技能消费:模型生成智能体技能的系统研究

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文系统研究了模型生成技能在语言智能体中的全生命周期(经验生成、技能提取、技能消费),通过构建效用评估框架发现技能平均有益但存在负迁移,并提出了元技能以提升技能质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI 79%

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03260 2026-05-25 cs.CE cs.CL 79%

SciNet: Evaluating AI Agents in Relation-Aware Scientific Literature Retrieval

SciNet: 评估关系感知科学文献检索中的AI代理

Chenyang Shao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University, Beijing, China(电子工程系、BNRist、清华大学、北京、中国) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.CL

AI总结 针对现有检索代理难以理解论文间复杂关系网络的问题,提出首个关系感知数据集SciNet,通过三类任务系统评估代理,发现准确率低于20%,但下游综述质量提升25.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22114 2026-05-25 eess.SY cs.SY 78%

Bearing-Only Solution to the Fermat-Weber Location Problem for Unicycle Agent

独轮车代理的Fermat-Weber位置问题的纯方位解

Hong Liang Cheah, Mohammad Deghat, Jose Guivant

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对独轮车代理的非完整约束,提出纯方位控制律以解决Fermat-Weber位置问题,包括静止信标、饱和输入和移动信标情况,并通过仿真和实验验证有效性。

Comments This paper has been accepted for presentation at the 23rd IFAC World Congress

Journal ref 23rd IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 74%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20896 2026-05-25 cs.CR cs.AI cs.LG 73%

GenAI-Driven Threat Detection with Microsoft Security Copilot

GenAI驱动的威胁检测与Microsoft Security Copilot

Scott Freitas, Amir Gharib

机构 * Microsoft Security Research(微软安全研究)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出动态威胁检测代理(DTDA),结合统一活动时间线、版本化LLM提示合同、规划器-执行器调查循环和动态告警生成,在Microsoft Security Copilot中实现持续、可解释的威胁检测,在线评估精确率80.1%,离线F1分数0.78。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23019 2026-05-25 cs.LG 70%

PACE: Two-Timescale Self-Evolution for Small Language Model Agents

PACE:小型语言模型代理的双时间尺度自我进化

Chen Ling, Pei Chen, Albert Guan, Jiaming Qu, Shayan Ali Akbar, Madhu Gopinathan, Erwin Cornejo

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 提出PACE框架,通过双时间尺度协调低风险提示优化与高风险控制逻辑更新,使冻结的小型语言模型在无需权重更新或依赖前沿模型的情况下实现自主自我进化,在12个骨干-基准组合上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23215 2026-05-25 cs.LG cs.AI cs.CL 67%

FastKernels: Benchmarking GPU Kernel Generation in Production

FastKernels:生产中GPU内核生成的基准测试

Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao Zhang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有基准与生产推理框架脱节的问题,提出FastKernels基准,包含46个代表性架构,覆盖96.2%的HuggingFace Transformers架构,并作为生产级推理框架,评估显示最强代理仅实现0.94倍加速,揭示基准-生产错位是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23170 2026-05-25 cs.CL cs.AI cs.LG 67%

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

长上下文LLM中的位置失败:推理基准测试中的盲点

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Central South University of Forestry and Technology(中央林业科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过提出上下文旋转评估(CRE)框架,系统控制任务位置、填充内容和上下文长度,揭示了长上下文推理基准测试中因任务位置变化导致的模型性能显著下降,并发现填充-答案干扰是主要错误模式。

Comments 20 pages, 1 figure, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 67%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23459 2026-05-25 cs.SE cs.AI 62%

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

AI 保证:企业 AI 系统的综合测试策略

Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

机构 * Thoughtworks Technologies(Thoughtworks技术公司)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对基于大语言模型、检索管道和自主代理的企业 AI 系统,提出了一种以持续风险降低为核心、将评估作为核心工程学科、并关注组织影响的综合保证策略,包括结构化的 AI 故障分类法、五层 AI 保证金字塔以及评估驱动开发、RAG 系统测试、模型生命周期管理和治理的操作指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 62%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18000 2026-05-25 cs.LG cs.AI q-bio.PE 62%

Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning

空间流行病模拟中的奖励工程:个体行为学习的强化学习平台

Radman Rakhshandehroo, Daniel Coombs

机构 * Department of Computer Science University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Mathematics and Institute of Applied Mathematics University of British Columbia(数学系和应用数学研究所,不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ContagionRL平台,通过奖励函数设计系统评估空间流行病模拟中个体行为学习策略,发现势场奖励方法能有效提升非药物干预依从性和空间规避策略。

Comments 38 pages, 15 figures and 18 tables; Accepted to TMLR. OpenReview: https://openreview.net/forum?id=yPEASsx3hk

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11759 2026-05-25 cs.AI 57%

Retrieval Is Not Enough: Why Organizational AI Needs Epistemic Infrastructure

检索是不够的:为什么组织AI需要认知基础设施

Federico Bottino, Carlo Ferrero, Nicholas Dosio, Pierfrancesco Beneventano

机构 * Kakashi Ventures Accelerator (KVA)(Kakashi Ventures加速器) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出OIDA框架,通过类型化知识对象、知识重力引擎和问题原语,解决组织AI中检索系统缺乏认知结构的问题,并引入认知质量评分(EQS)进行评估。

Comments 10 pages, 2 figures, 8 tables, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23311 2026-05-25 cs.AI 57%

DART: Semantic Recoverability for Structured Tool Agents

DART:结构化工具代理的语义可恢复性

Ke Yang, Panpan Li, Zonghan Wu, Kejin Xu, Huaxi Huang, Xiaoshui Huang

机构 * MOS Intelligent Connectivity Technology Co. Ltd.(MOS智能连接技术有限公司) Sichuan Vocational College of Post and Telecom(四川邮电职业技术学院) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对结构化工具代理执行失败时局部恢复可能破坏下游已提交工作的语义一致性问题,提出DART运行时系统,通过形式化语义可恢复性并实施可接受性检查,在依赖和效果约束下选择安全的恢复点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02239 2026-05-25 cs.RO cs.AI 57%

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

LACY: 基于视觉-语言模型的语言-动作循环用于自我改进的机器人操作

Youngjin Hong, Houjian Yu, Mingen Li, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出LACY框架,通过联合学习语言到动作、动作到语言和语言一致性验证三个任务,实现机器人操作的自我改进,平均任务成功率提升56.46%。

Comments Accepted to ICRA 2026. Project page: https://vla2026.github.io/LACY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06858 2026-05-25 physics.soc-ph cs.AI nlin.AO 57%

Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models

大型语言模型中意见动态的交互与偏差效应的分离

Vincent C. Brockers, David A. Ehrlich, Viola Priesemann

机构 * Max-Planck-Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems(复杂系统动力学研究所) University of Göttingen(哥廷根大学) Campus Institute for Dynamics of Biological Networks(校园生物网络动力学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出贝叶斯框架分离主题偏差、同意偏差和锚定偏差,分析LLM在多步对话中的意见轨迹,发现意见快速收敛至共享吸引子,且微调可改变吸引子位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03784 2026-05-25 cs.LG 57%

Insulin Resistance Prediction From Wearables and Routine Blood Biomarkers

从可穿戴设备和常规血液生物标志物预测胰岛素抵抗

Ahmed A. Metwally, A. Ali Heydari, Daniel McDuff, Alexandru Solot, Zeinab Esmaeilpour, Anthony Z Faranesh, Menglian Zhou, David B. Savage, Conor Heneghan, Shwetak Patel, Cathy Speed, Javier L. Prieto

机构 * Google Research(谷歌研究) Institute of Metabolic Science, University of Cambridge(剑桥大学代谢科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究利用可穿戴设备时间序列数据和血液生物标志物,通过深度神经网络模型预测胰岛素抵抗,在最大规模远程招募数据集上实现了优于单一数据源的性能,并展示了模型在肥胖和久坐人群中的高灵敏度及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23629 2026-05-25 cs.CV 50%

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准

Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) Aalto University(阿尔托大学) Imperial College London(伦敦帝国学院)

专题命中 Agent评测 :planning(abstract)

AI总结 提出DDX-TRACE基准,通过隐藏证据的多轮诊断轨迹评估VLM在神经放射学中的工作流质量,揭示最终诊断分数无法反映的推理缺陷。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23187 2026-05-25 cs.CV cs.RO 50%

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

IntentionNav: 一种基于隐式人类指令的意图驱动目标导航基准

Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin

机构 * The University of Manchester(曼彻斯特大学) A*STAR Responsible AI Research Centre, Adelaide University(阿德莱德大学负责任人工智能研究中心) University of Bedfordshire(贝福德郡大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出IntentionNav基准,通过隐式人类指令(如“我需要热一下食物”)驱动智能体推断目标物体并导航至其位置,实验表明当前模型在终端成功率和精确定位方面存在显著瓶颈。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏