arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-08 至 2026-05-08 共收录 29 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 29 篇

2602.03117 2026-05-08 cs.CR 87%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 86%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 85%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 Agent评测 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06068 2026-05-08 cs.AI cs.DC 85%

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe: 人工智能代理能否构建定制化的LLM服务系统?

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI 85%

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 83%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA 82%

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05868 2026-05-08 cs.CR 82%

SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills

SkillScope:迈向细粒度最小特权执行的代理技能

Jiangrong Wu, Yuhong Nan, Yixi Lin, Huaijin Wang, Yuming Xiao, Shuai Wang, Zibin Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出SkillScope框架,通过图分析方法实现细粒度最小特权执行,检测技能超特权行为,实验表明其在检测和约束超特权方面效果显著。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05379 2026-05-08 cs.AI cs.CC cs.ET 79%

Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems

部分证据基准:在代理系统中受授权限制的证据基准测试

Krti Tallam

机构 * KamiwazaAI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出Partial Evidence Bench,用于评估代理系统在授权限制下的证据处理能力,通过四个维度评估系统表现,展示不同行为模式对完成度的影响。

Comments Benchmark paper with deterministic synthetic corpora, 14 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 79%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 78%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 78%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 77%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05250 2026-05-08 cs.IR cs.AI 74%

Decision-aware User Simulation Agent for Evaluating Conversational Recommender Systems

面向决策意识的用户模拟代理用于评估对话推荐系统

Yuan-Chi Li, Li-Chi Chen, Sung-Yi Wu, Yu-Che Tsai, Shou-De Lin

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出Hesitator框架,通过模块化决策模块模拟人类在选择过载下的决策过程,实验表明其能有效缓解模拟器在高过载条件下的不现实行为,复现了心理学经济学中的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06490 2026-05-08 cs.AI cs.CY 70%

Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

工具选择:测量LLM代理追求工具性行为的倾向

Jonas Wiedermann-Möller, Leonard Dung, Maksym Andriushchenko

机构 * Universität Bielefeld(比勒菲尔德大学) Ruhr-Universität Bochum(波鸿鲁尔大学) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 Agent评测 :AI agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一个基准测试,用于衡量终端基于代理的模型在追求工具性收敛行为的倾向,通过七个操作任务评估十种模型,发现工具性行为集中且系统性,但低提示环境下的危险行为表现较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06345 2026-05-08 cs.AI 70%

More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation

比能说的更多:一个预问题科学构想的基准和框架

Jie Yu, Song Qiu

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理关键实验室) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出InciteResearch框架,通过分解苏格拉底提问逻辑链,将隐性理解显性化,解决科研初始模糊输入问题,并引入TF-Bench基准,展示AI在思维延伸中的作用。

Comments 19 pages, 2 figures; Code is available at https://github.com/Paradoxtcal/InciteResearch.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05475 2026-05-08 cs.AI 70%

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

意图性是一种设计决策:测量功能意图性以实现可问责的AI系统

Allessia Chiappetta, Robert Mahari

机构 * CodeX, The Stanford Center for Legal Informatics(CodeX,斯坦福法律信息学中心)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出功能意图性测试(FIT)框架,用于量化AI系统意图性行为,通过五维指标评估系统意图性,以实现对高自主性系统的可控问责。

Journal ref AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 62%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06066 2026-05-08 cs.LG cs.AI 62%

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

因果强化学习在复杂卡牌游戏中的应用:《魔法:英雄冒险》基准测试

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu

机构 * Department of Computer Science and Software Engineering, University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MTG-Causal-RL基准测试,通过Magic: The Gathering游戏中的复杂环境,结合因果结构和掩码动作空间,评估因果信用分配、跨 archetype 转移和策略可审计性等核心问题。

Comments 21 pages, 8 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16811 2026-05-08 cs.LG 57%

Graph Learning Is Suboptimal in Causal Bandits

图学习在因果老虎机中是次优的

Mohammad Shahverdikondori, Jalal Etesami, Negar Kiyavash

机构 * College of Management of Technology, EPFL(EPFL技术管理学院) Department of Computer Science, TU Munich(慕尼黑技术大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在因果充分性条件下因果老虎机的 regrets 最小化问题,发现学习父集并非最优策略,并提出无需图学习的近优算法。

Comments 32 pages, accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05726 2026-05-08 cs.AI 57%

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

SkillRet:一种大规模技能检索基准,用于LLM代理

Hongcheol Cho, Ryangkyung Kang, Youngeun Kim

机构 * ThakiCloud

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05280 2026-05-08 cs.LG 57%

Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

预测汽车行业的绿色技能需求:来自在线招聘信息的证据

Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos, Patricia Caratozzolo

机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 50%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 Agent评测 :planning(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06451 2026-05-08 cs.GT econ.TH 50%

Counterexamples to EFX for Submodular and Subadditive Valuations

对子模和子加性估值的EFX的反例

Simon Mackenzie, Mashbat Suzuki

专题命中 Agent评测 :agent(abstract)

AI总结 本文构造了三个代理人八个物品的实例,证明在单调子加性估值下,不存在满足α-EFX的分配,且提供了子模(实际上加权覆盖)估值下的相关反例,展示了对称性对EFX存在的阻碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06393 2026-05-08 cs.CR 50%

Constraining Host-Level Abuse in Self-Hosted Computer-Use Agents via TEE-Backed Isolation

通过TEE后置隔离约束自托管计算机使用代理的主机级滥用

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于操作的风险约束模型,通过TEE后置可信操作平面保护关键安全功能,实现对自托管计算机使用代理操作的安全限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05901 2026-05-08 cs.CE 50%

Duplicate-Aware Shift-and-Lift Carleman Linearization:Structure, Complexity, and Comparative Evaluation

具有重复意识的移位-提升Carleman线性化:结构、复杂性和比较评估

Takaki Akiba, Youhi Morii

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一种移位-提升架构以消除Carleman线性化中因状态维度和截断阶数增加而产生的重复单项式贡献,通过移动中心扩展提高高阶截断的实用性,并通过对比实验验证了该方法在双线性驱动和逻辑交互等基准测试中的收敛性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05752 2026-05-08 stat.ME stat.AP 50%

Generative AI-Based Monte Carlo Simulation for Method Evaluation Using Synthetic Multilevel Data

基于生成AI的蒙特卡洛模拟用于方法评估的合成多级数据

Youmi Suk, Chenguang Pan, Weixuan Xiao

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一种基于生成AI的多级数据模拟框架,用于评估定量方法的预测性能和参数恢复能力,通过改进扩散模型和GANs提升数据真实性,并系统评估模拟设计的可靠性。

Comments 31 pages for the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05448 2026-05-08 cond-mat.soft cond-mat.stat-mech 50%

Breakdown of Emergent Chiral Order and Defect Chaos in Nonreciprocal Flocks

非互易鸟群中涌现手性秩序的崩溃与缺陷混沌

Charlotte Myin, Suropriya Saha, Benoît Mahault

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示非互易鸟群中手性秩序易崩溃,通过模拟与连续描述显示拓扑缺陷导致旋转手性态破坏,产生时空混沌并具有有限相关长度。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26808 2026-05-08 cs.GT cs.IT math.IT 50%

MISES: Minimal Information Sufficiency for Effective Service

MISES: 最小信息充分性以实现有效服务

Joss Armstrong

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了基于类别的协调机制,通过将声明的服务类别映射到固定资源配置来分配资源,不观察个体需求类型。研究发现,相对福利差距Delta在聚合类内分配方差epsilon的范围内有紧致的双侧界,并证明了需求衍生的类别同时最小化福利损失和误报激励。

详情

展开后加载摘要…

URL PDF HTML 收藏