arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 352 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 55 篇

2606.15320 2026-06-16 cs.CV 新提交 83%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08867 2026-06-16 cs.CL 新提交 83%

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架

Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

机构 * Nubank

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出一个统一框架,通过评估驱动开发、上下文工程、人工循环提示迭代和LLM评判一致性优化,在Nubank的100M+用户规模下实现客户支持AI代理的离线开发与在线效果桥接,并在五个生产部署中验证了离线指标与在线结果的高度相关性。

Comments 12 pages. Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06738 2026-06-16 cs.CR cs.AI 版本更新 83%

Trust Without Trusting: A Recomputable Trust Protocol for Autonomous Agents

无需信任的信任:面向自主智能体的可重算信任协议

Lars Kersten Kroehl

机构 * MolTrust / CryptoKRI GmbH(MolTrust/加密KRI GmbH)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出组合证据协议(CEP),通过五条件谓词和锚定数据重算,使任何方都能独立验证边界所有者是否遵循其公开规则,解决了开放代理世界中依赖他人边界时的信任验证问题。

Comments 18 pages, 5 figures. v2: substantial revision, reframed around recomputable accountability (Combined Evidence Protocol); adds figures, code listings, and deployment evidence. Supersedes v1 (From Specification to Deployment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新 83%

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 82%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15225 2026-06-16 cs.LG cs.AI cs.IR 新提交 82%

Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call

Edu-Theater: 一种通过点名排演实现可扩展学习者行为模拟的数据高效智能体框架

Weibo Gao, Qi Liu, Linan Yue, Zheng Zhang, Yichao Du, Fangzhou Yao, Ao Yu, Zhenya Huang, Shijin Wang

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) iFLYTEK Co., Ltd.(科大讯飞股份有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Edu-Theater框架,通过构建群体水平能力先验和少量诊断查询,利用LLM智能体模拟学习者行为,在减少数据需求的同时提高模拟精度,并增强下游自适应测试等应用。

Comments LLM Agent, Educational Data Mining, Data Synthesis, Human Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16988 2026-06-16 cs.SE cs.LG 新提交 81%

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体轨迹作为程序:编码智能体行为的指纹识别与编程

Hamidah Oderinwale

机构 * McGill University(麦吉尔大学) Taste Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 提出通过程序性表示分析智能体行为模式,实现轨迹指纹识别(85.7%准确率),并开发ProcGrep库用于审计和评估智能体任务处理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15940 2026-06-16 cs.LG 新提交 79%

Causal-Privacy Audit Workflow for Synthetic and Distilled Data in Dropout Support

辍学支持中合成与蒸馏数据的因果隐私审计工作流

Hanghang Zheng, Xiwei Zhuang, Zhong Wang, Hong Liu, Xiao Chen, Jingwen He, Xia Li

机构 * Central University of Finance and Economics(中央财经大学) China Development Bank(中国发展银行) University of Cambridge(剑桥大学)

专题命中 Agent评测 :workflow(title,abstract);分类 cs.LG

AI总结 提出CaP-Eval工作流,在固定估计目标下审计合成学生数据的预测效用、因果保真度和隐私风险,发现DPGNet和蒸馏数据在保留处理效应结构上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15242 2026-06-16 cs.CR cs.AI 新提交 79%

Benign in Isolation, Harmful in Composition: Security Risks in Agent Skill Ecosystems

孤立无害,组合有害:智能体技能生态系统中的安全风险

Yi Xie, Jiawei Du, Yu Cheng, Jiuan Zhou, Zhaoxia Yin

机构 * East China Normal University(东华大学) Centre for Frontier AI Research A*STAR(前沿人工智能研究中心A*STAR) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出技能组合风险(SCR)概念,通过SCR-Bench基准测试发现,多个技能在共享上下文中组合执行时,攻击成功率显著高于孤立评估,强调应基于激活路径评估技能安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11692 2026-06-16 cs.CY cs.AI cs.MA cs.SI 新提交 79%

Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator

基于智能体模拟器的审议式投票中替代性信息系统评估

Rwaida Alssadi, Khulud Alawaji, Balaji Kasula, Muntaser Syed, Badria Alfurhood, Markus Zanker, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院) Princess Nourah Bint Abdulrahman(纳厄赫·阿卜杜勒拉赫曼公主) Free University of Bozen-Bozano(博兹诺-博萨诺自由大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出基于LLM的智能体双极论证模拟器(ABAS),通过覆盖率和语料多样性评估审议式投票中推荐机制的有效性,并测试了对抗性投票攻击下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08270 2026-06-16 cs.CR cs.AI cs.ET 新提交 79%

An AI Security Agent for University ACMIS: Multi-Vector Threat Detection and Automated Response

面向大学教务管理信息系统的AI安全代理:多向量威胁检测与自动响应

Joseph Walusimbi, Joshua Benjamin Ssentongo

机构 * University ACMIS(ACMIS大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出一种结合监督异常检测、行为分析和NLP聊天机器人的AI安全代理,针对ACMIS的五个操作层进行监控,并通过四级风险升级框架实现自动响应,在模拟数据集上达到0.91的F1分数。

Comments 6 pages, 1 figure, 5 tables,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09163 2026-06-16 cs.AI 版本更新 79%

FORTIS: Benchmarking Over-Privilege in Agent Skills

FORTIS:评估代理技能中的过度特权

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究发现,当前代理技能层普遍存在过度特权问题,模型在选择和执行技能时常超出任务需求,导致性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11047 2026-06-16 cs.CR cs.AI 版本更新 79%

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw

红队代理执行上下文:OpenClaw上的开放世界安全评估

Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出DeepTrap框架,通过黑盒轨迹优化发现OpenClaw中的上下文漏洞,展示上下文妥协可引发安全风险,强调需执行中心的安全评估。

Comments Accepted to ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21862 2026-06-16 cs.AI cs.MA cs.SI econ.GN q-fin.EC 版本更新 79%

Shachi: A Modular, Controllable Framework for LLM-Based Agent-Based Modeling of Emergent Collective Behavior

Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架

So Kuroki, Yingtao Tian, Kou Misaki, Takashi Ikegami, Takuya Akiba, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI) The University of Tokyo, Japan(日本东京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。

Comments Accepted to ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14715 2026-06-16 cs.MA cs.AI cs.SI 新提交 74%

MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions

MiroBench:真实世界讨论的智能体模拟真实性基准测试

Yaoning Yu, Ye Yu, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Starc.Institute(Starc研究院)

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 提出MiroBench基准,基于4292条真实Reddit帖子,通过统计测试评估LLM智能体模拟在重复性、叙事内容、毒性攻击和结构复杂度四个方面的分布匹配度,发现当前模拟器与真实讨论存在分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15306 2026-06-16 cs.LG cs.AI 新提交 73%

LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

LatentGym: 具有可控潜在结构的跨任务经验学习测试平台

Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

机构 * Columbia University(哥伦比亚大学) Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。

Comments 61 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10047 2026-06-16 cs.SE cs.AI cs.HC 73%

Toward Epistemic Stability: Engineering Consistent Procedures for Industrial LLM Hallucination Reduction

迈向认知稳定性:为工业大语言模型幻觉减少设计一致的程序

Brian Freeman, Adam Kicklighter, Matt Erdman, Zach Gordon

机构 * Trane Technologies(特纳技术公司)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出并比较了五种提示工程策略,旨在减少模型输出的方差,实现可重复、基于事实的结果。通过LLM-as-Judge框架评估,M4在100次试验中均表现最佳,M2在v2版本中提升显著。

Comments 50 pages, 5 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02668 2026-06-16 cs.AI cs.LG 版本更新 73%

SorryDB: Can AI Provers Complete Real-World Lean Theorems?

SorryDB: AI证明者能完成现实世界的Lean定理吗?

Austin Letson, Leopoldo Sarra, Auguste Poiroux, Oliver Dressler, Paul Lezeau, Dhyan Aranha, Frederick Pu, Aaron Hill, Miguel Corredera Hidalgo, Julian Berman, George Tsoukalas, Lenny Taelman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出动态更新的基准SorryDB,包含78个GitHub上的现实形式化项目,评估AI证明者在复杂依赖下的能力,发现当前方法互补,基于Gemini Flash的智能体方法表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16605 2026-06-16 cs.AI 新提交 70%

ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control

ARB4WM:连续控制中世界模型的对抗鲁棒性基准

Junjian Zhang, Hao Tan, Ruonan Li, Dong Zhu, Aiping Li, Zhaoquan Gu

机构 * College of Computer Science, National University of Defense Technology(国防科技大学计算机学院) College of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of New Networks, Peng Cheng Laboratory(鹏城实验室新型网络部) National Key Laboratory of Advanced Communication Networks(先进通信网络全国重点实验室)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ARB4WM统一基准,从策略、价值和潜在动力学三个层面评估世界模型在视觉扰动下的对抗鲁棒性,发现多目标攻击和时序暴露模式对安全评估至关重要。

Comments 24 pages, 10 figures, 5 tables. Source code available at https://github.com/zaoanguai/ARB4WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16596 2026-06-16 cs.CL 新提交 70%

How Far Can Machine Translation Quality Take You? Extrinsic Discourse Evaluation in Goal-Oriented Setups

机器翻译质量能带你走多远?目标导向设置中的外在话语评估

Wafaa Mohammed, Kata Naszadi, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 研究机器翻译在静态和交互式目标导向任务中的外在话语评估,发现高内在翻译质量不能保证下游话语成功,且强系统仍存在指代不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16190 2026-06-16 cs.AR cs.AI 新提交 70%

Embedded Arena: Iterative Optimization via Hardware Feedback

嵌入式竞技场:通过硬件反馈的迭代优化

Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu, Chun-Cheng Chang, Jiayi Shao, Yujia Liu, Emmanuel Azuh Mensah, Edward Wang, Kurtis Heimerl, Gregory D. Abowd, Shwetak Patel, Natasha Jaques, Vikram Iyer

机构 * University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出硬件在环智能体框架,通过迭代编译、烧录和测量真实硬件,实现模型与固件的闭环优化,在嵌入式设备上达到250倍压缩且精度损失<3.3%。

Comments Code: https://github.com/ubicomplab/embedded-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16903 2026-06-16 cs.DB 新提交 67%

Directory-Aware Query and Maintenance in Vector Databases

向量数据库中的目录感知查询与维护

Mengzhao Wang, Zheng Gong, Jingpei Hu, Jiajie Fu, Maojia Sheng, Junwen Chen, Yifan Zhu

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 针对向量数据库缺乏层次目录语义的问题,提出目录语义查询(DSQ)和目录语义维护(DSM)算子,并评估三种实现策略,其中基于Trie的层次索引(TrieHI)通过树遍历实现高效递归检索并降低维护成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16748 2026-06-16 cs.LG cs.CL 新提交 62%

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

MyPCBench: 个人智能计算机使用代理的基准测试

Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出MyPCBench基准,在模拟真实桌面环境(含17个Web应用)中测试个人计算机使用代理,发现最佳模型Claude Opus 4.6仅解决55.4%任务,失败集中在多应用和长轨迹任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 62%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16262 2026-06-16 cs.SE cs.AI 新提交 62%

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05692 2026-06-16 cs.LG cs.AI 版本更新 62%

Benchmarking Counterfactual Prediction in Epidemic Time Series with Time-Varying Interventions

具有时变干预的流行病时间序列中的反事实预测基准测试

Wenhao Mu, Facundo Yan, Anik Mumssen, Marisa Eisenberg, Alexander Rodríguez

机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) University of Michigan Epidemiology & Complex Systems(密歇根大学流行病学与复杂系统)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 为解决缺乏可观测反事实结果的真实基准问题,基于校准的基于智能体的模型生成大规模流行病时间序列反事实预测基准,支持静态/时变治疗和单/多策略干预,评估多种因果推断方法。

Comments To appear in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26418 2026-06-16 cs.LG cs.AI cs.DC 版本更新 62%

When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control

深度强化学习何时超越校准基线?自适应资源控制的基准研究

Guilin Zhang, Chuanyi Sun, Kai Zhao, Xu Chu, Shahryar Sarkani, John Fossaceca

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过RLScale-Bench基准测试,发现校准的基于规则的自动缩放器在所有工作负载上成本均低于六种主流深度强化学习算法,并揭示了算法选择、基线校准和评估协议的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16902 2026-06-16 cs.AI cs.LG 版本更新 62%

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试:大语言模型在真实知识图谱上的规划能力有多强?

Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University of Oxford, UK(牛津大学,英国) University College London (Centre for AI), UK(伦敦大学学院(人工智能中心),英国) University of Basel, Switzerland(巴塞尔大学,瑞士)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-Wikirace 基准,通过维基百科超链接导航任务评估大语言模型的规划、推理与世界知识,发现模型在简单任务上超人类,但困难任务成功率仅 23%,且规划与长程推理是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17005 2026-06-16 cs.AI stat.ME 新提交 57%

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

前沿AI评估公共档案的贝叶斯推断与决策审计

Yanan Long

机构 * Yanan Long

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文通过贝叶斯推断和审计方法,分析公共AI评估档案中的选择性报告和缺失数据,发现单一终端记录与多种历史路径兼容,并验证了审计门限对虚假声明的过滤作用。

详情

展开后加载摘要…

URL PDF HTML 收藏