arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-15 至 2026-05-15 共收录 37 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2509.26100 2026-05-15 cs.AI 85%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14002 2026-05-15 cs.AI 85%

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

PolitNuggets: 评估代理发现长尾政治事实

Yifei Zhu

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。

Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 85%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03596 2026-05-15 cs.AI cs.CL cs.DB cs.LG 85%

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Workspace-Bench 1.0:基于大规模文件依赖的AI代理工作空间基准测试

Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Workspace-Bench 1.0,通过构建包含5个工人配置、74种文件类型和20,476个文件的现实工作空间,评估AI代理在处理大规模文件依赖任务中的能力,发现当前代理在工作空间学习中表现远低于人类水平。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14865 2026-05-15 cs.AI cs.CL 84%

Holistic Evaluation and Failure Diagnosis of AI Agents

人工智能代理的总体评估与故障诊断

Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai Nir, Orel Shalom, Yaron Friedman, David Connack, Amos Rimon, Philip Tannor, Shir Chorev

机构 * Deepchecks

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种综合评估框架,结合顶层代理诊断与底层跨度评估,通过分解分析实现独立跨度评估,提升长结构轨迹中的故障定位与分类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14033 2026-05-15 cs.AI cs.LG 84%

Sheaf-Theoretic Transport and Obstruction for Detecting Scientific Theory Shift in AI Agents

示性同调运输与障碍在检测人工智能代理科学理论转变中的应用

David N. Olivieri, Roque J. Hernández

机构 * Universidade de Vigo, Department of Computer Science (LSI), Spain(维戈大学计算机科学系(LSI),西班牙)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于有限示性同调框架的方法,用于检测人工智能代理中科学理论转变的候选者,通过运输和障碍分析,区分理论框架的可运输性与局部到全局的障碍问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15109 2026-05-15 cs.AI cs.IR 83%

Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

为什么社区重要:代理图RAG中的遍历上下文与溯源

Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark, Alsion 2, 6400 Sønderborg, Denmark(丹麦南部大学工业软件中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨了代理图RAG中引用忠实性的轨迹层面问题,通过实验表明引用证据和遍历上下文都对答案准确性有影响。

Comments 7 pages, 2 figures, Submitted at IJCAI-ECAI 2026 Joint Workshop on GENAIK and NORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14460 2026-05-15 cs.CR cs.SE 83%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 83%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 83%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 82%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 81%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14723 2026-05-15 cs.AI cs.CL cs.LG 80%

Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model

通过与临床世界模型交互实现患者动态的智能体化

Minghao Wu, Yuting Yan, Zhenyang Cai, Ke Ji, Chuangsen Fang, Ziying Sheng, Xidong Wang, Rongsheng Wang, Hejia Zhang, Shuang Li, Benyou Wang, Hongyuan Zha

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SepsisAgent,通过临床世界模型模拟患者对液体-血管加压药干预的响应,采用提出-模拟-细化流程进行脓毒症治疗推荐,优于传统RL和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14016 2026-05-15 cs.SE cs.SD 79%

Case Studies and Reflections on Agentic Software Engineering for Rapid Development of Digital Music Instruments

代理软件工程在快速开发数字音乐乐器中的案例研究与反思

Matthew John Yee-King

机构 * Computing, Goldsmiths(Goldsmiths 计算学系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE

AI总结 本文通过三个案例研究展示代理软件工程在开发数字音乐乐器中的应用,探讨其降低入门门槛和提升软件兼容性与可持续性的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01847 2026-05-15 cs.AI 79%

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准

Xiao Jia

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14126 2026-05-15 cs.LG cs.AI 73%

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

用于快速医疗互操作资源(FHIR)的强化学习工具调用代理

Marius S. Knorr, Robert Müller, Jan P. Bremer, Nils Schweingruber

机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 70%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 70%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 62%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14501 2026-05-15 eess.SY cs.AI cs.LG cs.SY 62%

Fully Dynamic Rebalancing in Dockless Bike-Sharing Systems via Deep Reinforcement Learning

通过深度强化学习实现无桩自行车共享系统的全动态再平衡

Edoardo Scarpel, Alberto Pettena, Matteo Cederle, Federico Chiariotti, Marco Fabris, Gian Antonio Susto

机构 * University of Padua(帕多瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的模拟器和马尔可夫决策过程的深度强化学习方法,实现无桩自行车共享系统的全动态再平衡,减少车辆短缺并降低空间不平等。

Comments 6 pages, 5 figures, 1 table, accepted at the 23rd IFAC World Congress, Busan, South Korea, Aug. 23-26, 2026. Open invited track 9-131: "Control and Optimization for Smart Cities"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07833 2026-05-15 cs.LG cs.AI 62%

Gradient Iterated Temporal-Difference Learning

梯度迭代时间差学习

Théo Vincent, Kevin Gerhardt, Yogesh Tripathi, Habib Maraqten, Adam White, Martha White, Jan Peters, Carlo D'Eramo

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出梯度迭代时间差学习方法,通过计算移动目标的梯度提升学习速度,对比半梯度方法在Atari游戏等基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 62%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14779 2026-05-15 cs.LG 57%

Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning

彭的Q(λ)在离线强化学习中的保守价值估计

Byeongchan Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于离线多步强化学习的算法CPQL,通过保守价值估计替代贝尔曼算子,实现了更优的性能保证和鲁棒性改进。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI 57%

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14261 2026-05-15 cs.AI cs.GT 57%

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

启发式病态及通过不确定性传播进一步方差缩减在AIVAT技术家族中

Juho Kim, Tuomas Sandholm

机构 * CMU Strategic Machine, Inc.(CMU战略机器公司) Strategy Robot, Inc.(策略机器人公司) Optimized Markets, Inc.(优化市场公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了AIVAT技术中启发式价值函数的潜在漏洞,并通过不确定性传播进一步减少方差,实验显示可减少43%的样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15620 2026-05-15 cs.LG 57%

Closing the Gap on the Sample Complexity of 1-Identification

缩小1-识别问题样本复杂度的差距

Zitian Li, Wang Chi Cheung

机构 * Department of Industrial Systems Engineering & Management(工业系统工程与管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了多臂老虎机中的1-识别问题,提出新的下界和算法,统一界内匹配至多项式对数因子,补充了多合格臂情况下的样本复杂度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14067 2026-05-15 cs.LG 57%

Comparative Evaluation of Machine Learning Approaches for Minority-Class Financial Distress Prediction Under Class Imbalance Constraints

机器学习方法在类不平衡约束下对少数类财务困境预测的比较评估

Karan Sehgal, Khawar Naveed Bhatti

机构 * Kent Business School(肯特商学院) University of Kent(肯特大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文比较了统计方法、集成学习和神经网络模型在类不平衡数据下的少数类财务困境预测效果,验证了梯度提升方法在严重不平衡情况下的优越性。

Comments 16 pages, 4 figures, preprint under review. Applied machine learning evaluation involving imbalance-aware financial distress prediction, ensemble learning, SMOTE, and SHAP explainability analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13849 2026-05-15 cs.AI 57%

Mixed Integer Goal Programming for Personalized Meal Optimization with User-Defined Serving Granularity

带有用户定义服务粒度的混合整数目标规划用于个性化餐优化

Francisco Aguilera Moreno

机构 * March 2026(2026年3月)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出混合整数目标规划(MIGP)解决个性化餐优化中的服务粒度和营养约束问题,通过整数变量和目标规划偏差实现更灵活的营养目标,且在多数情况下优于传统方法。

Comments 34 pages, 6 figures, open-source implementation

详情

展开后加载摘要…

URL PDF HTML 收藏