arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 410 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 15 篇

2605.10044 2026-05-12 cs.LG cs.AI 62%

Adaptive Action Chunking via Multi-Chunk Q Value Estimation

基于多片段Q值估计的自适应动作分块

Yongjae Shin, Jongseong Chae, Seongmin Kim, Jongeui Park, Youngchul Sung

机构 * KAIST(韩国科学技术院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应动作分块方法,通过动态调节分块长度提升强化学习性能,实验表明其在复杂环境中具有更好的泛化能力和学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00370 2026-05-12 cs.LG cs.CY cs.MM 57%

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

群体认知学习:通过受控的双阶段智能体协作使一切变得更好

Chunlei Meng, Pengbin Feng, Rong Fu, Hoi Leong Lee, Xiaojing Du, Zhaolu Kang, Zeyu Zhang, Weilin Zhou, Chun Ouyang, Zhongxue Gan

机构 * University of Macau(澳门大学) Universiti Malaysia Perlis(马来西亚霹雳大学) Peking University(北京大学) Xinjiang University(新疆大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。

Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08581 2026-05-12 cs.LG 57%

PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

PRISM: 通过调度-内存协同设计实现快速在线LLM服务

Xingyu Qu, Tianhao Lin, Yiqi Li, Zhiyu Chen, Sheng Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。

Comments 25 pages, 9 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09937 2026-05-12 cs.DC cs.FL 50%

Population Protocols over Ordered Agents

基于有序代理的人群协议

Michael Blondin, Michaël Cadilhac, Benjamin Courchesne, Lucie Guillou, Corto Mascle, Isa Vialard

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了基于有序代理的人群协议,探讨了其在识别无歧义星形自由语言中的作用,并展示了在特定条件下协议与空间复杂度的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09785 2026-05-12 eess.SY cs.GT cs.SY math.OC 50%

Action Recommendations for Sequentially Rational Strategic Agents

为序列理性战略代理制定动作推荐

Renyan Sun, Ashutosh Nayyar

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究如何通过动作推荐激励战略代理采用服从策略,提出基于逆向归纳法求解线性规划的算法,以实现设计者目标与代理序列理性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13451 2026-05-12 cs.RO 50%

MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 72 篇

2605.10365 2026-05-12 cs.AI 92%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 Agent评测 :agent(title,title_cn);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04284 2026-05-12 cs.AI cs.LG 91%

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

Agent-Omit:适应性上下文省略以提高LLM代理效率

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science(香港科学与技术大学人工智能前沿) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent-Omit框架,通过省略冗余思考和观察提升LLM代理效率,实验表明其在多个基准测试中表现优异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10516 2026-05-12 cs.AI 89%

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

一致性作为可检验的属性:评估AI代理可靠性的统计方法

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar

机构 * Northeastern University(东北大学) University of Pécs(佩奇大学) University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种评估AI代理可靠性的统计方法,通过输出级可靠性和轨迹级稳定性指标,揭示代理核心能力与执行鲁棒性之间的差异,验证了轨迹一致性指标在诊断敏感性上的优势。

Comments 33 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN 88%

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10763 2026-05-12 cs.AI cs.CR 87%

MATRA: Modeling the Attack Surface of Agentic AI Systems -- OpenClaw Case Study

MATRA:代理AI系统的攻击面建模——OpenClaw案例研究

Tim Van hamme, Thomas Vissers, Javier Carnerero-Cano, Mario Fritz, Emil C. Lupu, Lieven Desmet, Dinil Mon Divakaran

机构 * DistriNet, KU Leuven(DistriNet,根特大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Imperial College London(伦敦帝国理工学院) A*STAR Institute for Infocomm Research(A*STAR信息与通信研究机构)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出MATRA框架,用于评估代理AI系统中已知威胁转化为具体风险的机制,通过OpenClaw案例展示如何利用攻击树和安全控制降低风险。

Comments Accepted for presentation at the 5th International Workshop on Designing and Measuring Security in Systems with AI (DeMeSSAI 2026), co-located with the 11th IEEE European Symposium on Security and Privacy (EuroS&P 2026), Lisbon, Portugal, July 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 87%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10384 2026-05-12 cs.AI cs.DC cs.NI 85%

Agentic Performance at the Edge: Insights from Benchmarking

边缘端的代理性能:基准测试中的见解

Shiqiang Wang, Herbert Woisetschläger

机构 * University of Exeter(埃克塞特大学) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文探讨了在边缘系统中,受限于内存、功率和延迟的模型规模对代理任务质量的影响,提出了一种领域条件评估方法,并揭示了模型选择与工具工作流联合设计的重要性。

Comments Accepted to AutoEdge workshop, co-located with MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08941 2026-05-12 cs.AI 85%

MDGYM: Benchmarking AI Agents on Molecular Simulations

MDGYM:在分子模拟上评估AI代理的基准测试

Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10622 2026-05-12 cs.CL cs.AI cs.LG 85%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Thomas Schaaf, Esaú Villatoro-Tello, Ahmed Hassoon, Ricard Marxer, Petr Motlicek

机构 * Idiap Research Institute(Idiap研究 institute) Université de Toulon(里昂大学) Aix Marseille Univ(马赛大学) LIS(LIS实验室) Avignon University(阿维尼翁大学) Zenidoc University of Zurich(苏黎世Zenidoc大学) Stenograf Solventum CNRS & ILLS(Solventum CNRS与ILLs) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。

Comments Pre-print submitted to EACL System Demonstration (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08922 2026-05-12 cs.CR 85%

Toward Web 4.0: Bidirectional Trust between AI Agents and Blockchain

迈向Web 4.0:AI代理与区块链之间的双向信任

Yunfeng Xia, Chao Li, Lei Li, Chenhao Zhang, Li Duan, Runhua Xu, Wei Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract)

AI总结 本文探讨AI代理与区块链之间的双向信任机制,分析区块链为代理提供的信任基础设施及AI代理在区块链核心机制中的参与,揭示现有标准生态的不足及未来研究方向。

Comments due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10397 2026-05-12 cs.CV cs.AI 84%

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。

Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10858 2026-05-12 cs.CV cs.RO 83%

Is Your Driving World Model an All-Around Player?

你的驾驶世界模型是全能选手吗?

Lingdong Kong, Ao Liang, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Xian Sun, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract)

AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。

Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL 83%

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 83%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 83%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09684 2026-05-12 cs.CR cs.AI 83%

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

MonitoringBench: 面向代理监控的半自动化红队测试

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy

机构 * Independent(独立)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08545 2026-05-12 cs.AI 83%

Log analysis is necessary for credible evaluation of AI agents

对AI代理的可信评估需要日志分析

Peter Kirgis, Sayash Kapoor, Stephan Rabanser, Nitya Nadgir, Cozmin Ududec, Magda Dubois, JJ Allaire, Conrad Stosz, Marius Hobbhahn, Jacob Steinhardt, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Independent(独立) UK AISI(英国AISI) Meridian Labs(梅里登实验室) Transluce Apollo Research(Apollo研究) UC Berkeley(伯克利大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20798 2026-05-12 cs.AI 83%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 81%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 79%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10448 2026-05-12 cs.AI 79%

Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation

代理基准能否支持其分数?基于证据的交互代理评估的边界

Shanshan Gao, Liyi Zhou

机构 * The University of Sydney(悉尼大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种证据报告层,通过验证存储的艺术品来提高交互代理评估的可靠性,明确区分不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22953 2026-05-12 cs.AI 79%

General Agent Evaluation

通用智能体评估

Elron Bandel, Asaf Yehudai, Lilach Eden, Yehoshua Sagron, Yotam Perlitz, Elad Venezian, Natalia Razinkov, Natan Ergas, Shlomit Shachor Ifergan, Segev Shlomov, Michal Jacovi, Leshem Choshen, Liat Ein-Dor, Yoav Katz, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) MIT(麻省理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。

Comments Presented at the ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 77%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 77%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏