arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-05 至 2026-05-05 共收录 23 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 23 篇

2605.01147 2026-05-05 cs.AI 85%

Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment

位置:代理AI的安全性与公平性取决于交互拓扑,而非模型规模或对齐

Tanav Singh Bajaj, Nikhil Singh, Karan Anand, Eishkaran Singh

机构 * Department of Computer Science, University of British Columbia, Vancouver, Canada(英属哥伦比亚大学计算机科学系) Department of Artificial Intelligence, IIT Hyderabad, Hyderabad, India(印度海得拉巴理工学院人工智能系) Amazon, Delhi, India(印度德里亚马逊公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文指出代理AI的安全性由交互拓扑决定,而非模型规模或对齐程度。研究揭示了顺序不稳定、信息级联和功能崩溃等拓扑驱动的问题,并强调需通过动态系统视角评估安全性和公平性。

Comments 18 pages, 8 figures. Position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00876 2026-05-05 cs.LG cs.CV 85%

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

GAZE:基于视图级工具和文献检索的 grounded 零样本评估

Duaa Alim, Mogtaba Alim, Liam Chalcroft

机构 * Imperial College London, UK(伦敦帝国学院) University of Toronto, Canada(多伦多大学) University College London, UK(伦敦大学学院)

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.LG

AI总结 GAZE框架通过调用视图级工具和文献检索工具,使医学VLM在迭代方式下工作,实现对罕见脑MRI的零样本评估,提升病变定位和诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 84%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01214 2026-05-05 cs.AI cs.CY 83%

Agentic AI Systems Should Be Designed as Marginal Token Allocators

代理AI系统应作为边际令牌分配经济体进行设计

Siqi Zhu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出代理AI系统应以边际令牌分配经济体为设计框架,揭示各层在边际效益等于边际成本加延迟成本加风险成本的条件下,导致局部优化全局失衡的问题,提出令牌意识评估、自主定价、拥堵定价和服务风险调整等研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 82%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01604 2026-05-05 cs.AI 79%

Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework

在真实环境中评估代理AI:故障模式、漂移模式及生产评估框架

Mukund Pandey

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对代理AI在生产环境中持续运行时的评估挑战,提出七种故障模式分类及PAEF框架,揭示传统指标在检测故障模式上的不足。

Comments 11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 79%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01371 2026-05-05 cs.RO 78%

ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue

ESARBench: 一种用于代理无人机体感知搜索与救援的基准

Daoxuan Zhang, Ping Chen, Jianyi Zhou, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agentic(title);planning(abstract)

AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 77%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01562 2026-05-05 cs.SE cs.AI 73%

Neuro-Symbolic Agents for Hallucination-Free Requirements Reuse

神经符号代理用于无幻觉要求重用

Ahmed Ibrahim

机构 * Western University(西部大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出神经符号多代理系统,通过模型驱动 elicitation 过程实现无幻觉的要求重用,结合 LLM 和符号验证器确保结构有效性,实验显示 100% 覆盖率和 0.2% 违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16810 2026-05-05 cs.AI cs.CL cs.HC econ.GN q-fin.EC 73%

AI Realtor: Towards Grounded Persuasive Language Generation for Automated Copywriting

AI 房地产经纪人:迈向基于现实的说服性语言生成以实现自动化文案写作

Jibang Wu, Chenghao Yang, Yi Wu, Simon Mahns, Chaoqi Wang, Hao Zhu, Fei Fang, Haifeng Xu

机构 * Schmidt Sciences(施密特科学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于大语言模型的代理框架,用于房地产营销中的自动化文案写作中的基于现实的说服性语言生成。通过系统的人类受试者实验,证明了该方法在保持事实准确性的同时,生成的营销描述更受潜在购房者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 70%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02945 2026-05-05 cs.LG cs.AI 62%

Ergodic Risk Measures: Towards a Risk-Aware Foundation for Continual Reinforcement Learning

遍历风险度量:面向持续强化学习的风险感知基础

Juan Sebastian Rojas, Chi-Guhn Lee

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出遍历风险度量理论,用于持续强化学习,解决传统风险中性方法与持续学习不兼容的问题,通过新理论提升持续学习的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 62%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01358 2026-05-05 cs.LG 57%

PACE: Parameter Change for Unsupervised Environment Design

PACE:无监督环境设计的参数变化

Fang Yuan, Quanjun Yin, Siqi Shen, Yuxiang Xie, Junqiang Yang, Long Qin, Junjie Zeng, Qinglun Li

机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Test Center, National University of Defense Technology(国防科技大学测试中心) State Key Laboratory of Digital Intelligent Modeling(数字智能建模与仿真国家重点实验室) Fujian Key Laboratory of Urban Intelligent Sensing(福建城市智能感知重点实验室) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 PACE通过政策参数变化评估环境,提升强化学习泛化能力,实验显示在MiniGrid和Craftax上优于现有无监督环境设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01082 2026-05-05 cs.LG cs.GT econ.TH 57%

Networked Information Aggregation for Binary Classification

基于网络的信息聚合用于二分类

MohammadHossein Bateni, Zahra Hadizadeh, MohammadTaghi Hajiaghayi, Mahdi JafariRaviz, Shayan Taherijam

机构 * University of Maryland, College Park, MD, USA(马里兰大学学院市分校) Google Research, New York City, NY, USA(谷歌研究纽约市分校) University of California, Irvine, CA, USA(加州大学尔湾分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究网络二分类中信息聚合问题,通过序列分布式训练流程分析信息聚合效果,证明深度对信息聚合的限制。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01186 2026-05-05 cs.CR 50%

Trace: Unmasking AI Attack Agents Through Terminal Behavior Fingerprinting

Trace:通过终端行为指纹揭示AI攻击代理

Murali Ediga, Sudipta Chattopadhyay

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Trace框架,通过终端命令序列识别AI攻击代理模型家族,利用防御性提示注入策略提取系统提示,提升攻击意图分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01128 2026-05-05 cs.NI 50%

MORPH: Multi-Environment Orchestrated Reinforcement Learning for PRB Handling in O-RAN

MORPH:多环境协同强化学习用于O-RAN中PRB处理

Alireza Ebrahimi Dorcheh, Tolunay Seyfi, Ryan Barker, Fatemeh Afghah

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出MORPH,基于O-RAN中PRB级频谱分配的多环境协同强化学习框架,结合测量和仿真数据提升切片性能和SLA合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01094 2026-05-05 cs.DC cs.NI 50%

ncsim: A Lightweight Simulator for Networked Edge Computing with Wireless Interference Modeling

ncsim:一种用于网络边缘计算的轻量级模拟器,包含无线干扰建模

Bhaskar Krishnamachari, Maya Gutierrez, Jared Coleman

专题命中 Agent评测 :workflow(abstract)

AI总结 ncsim通过结合DAG工作流调度与物理基础的IEEE 802.11 CSMA/CA干扰建模,解决无线边缘计算中计算放置与干扰建模的耦合问题,实验显示干扰影响显著导致调度器排名反转。

Comments 13 pages, 9 figures. Code and experimental configurations available at https://github.com/ANRGUSC/ncsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00439 2026-05-05 cs.GT 50%

Strategyproof Facility Location with Prediction: Minimizing the Maximum Cost

具有预测的策略证明设施选址:最小化最大成本

Hau Chan, Jianan Lin, Chenhao Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在学习增强框架下设施选址的机制设计问题,设计出策略证明机制以在预测误差下最小化最大成本,分析了MinMaxP机制在不同空间中的逼近保证。

Comments v1 as the conference version is published in ECAI 2025; v2 as the journal extension is published in JAAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08202 2026-05-05 math.PR 50%

The mean field stubborn voter model

均场顽固投票者模型

Lisa Hartung, Christian Mönch

专题命中 Agent评测 :agent(abstract)

AI总结 研究投票模型中代理依赖的厚尾等待时间对完全图的影响,推导新的标度极限并证明最慢更新站点的极限无限投票者模型存在性,明确计算共识概率。

Comments 31 pages; v2 contains some minor fixes as well as extension of the allowed weight distributions

详情

展开后加载摘要…

URL PDF HTML 收藏