arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Washington(华盛顿大学)

2026-04-29 至 2026-04-29 共收录 3
2604.24955 2026-04-29 cs.CL cs.AI cs.SE

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

BenchGuard:谁守护着基准?对LLM代理基准的自动化审计

Xinming Tu, Tianze Wang, Yingzhou, Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

机构 * Allen School, University of Washington(华盛顿大学阿伦学院) Phylo, Inc.(Phylo公司) Genentech, Inc.(基因泰克公司)

AI总结 BenchGuard通过结构化LLM协议交叉验证所有基准制品,发现ScienceAgentBench中的12个问题,并在BIXBench Verified-50子集中准确识别83.3%的问题,证明自动化基准审计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00065 2026-04-29 cs.CY cs.AI

Responsible Evaluation of AI for Mental Health

人工智能心理健康应用的责任评估

Hiba Arnaout, Anmol Goel, H. Andrew Schwartz, Steffen T. Eberhardt, Dana Atzil-Slonim, Gavin Doherty, Brian Schwartz, Wolfgang Lutz, Tim Althoff, Munmun De Choudhury, Hamidreza Jamalabadi, Raj Sanjay Shah, Flor Miriam Plaza-del-Arco, Dirk Hovy, Maria Liakata, Iryna Gurevych

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Vanderbilt University(范德比尔特大学) Trier University(特里尔大学) Bar-Ilan University(巴伊兰大学) Trinity College Dublin(都柏林三一学院) University of Washington(华盛顿大学) Georgia Institute of Technology(佐治亚理工学院) Phillips-Universität Marburg(马尔堡菲利普大学) LIACS, Leiden University(莱顿大学LIACS研究中心) Bocconi University(博科尼大学) Queen Mary University London(伦敦玛丽女王大学) Alan Turing Institute(艾伦·图灵研究所)

AI总结 本文提出跨学科框架,整合临床有效性、社会背景和公平性,解决现有AI心理健康工具评估碎片化问题,并通过案例研究展示AI心理健康支持类型的分类方法。

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01930 2026-04-29 cs.IR cs.AI

MCGI: Manifold-Consistent Graph Indexing for Billion-Scale Disk-Resident Vector Search

MCGI:用于十亿级磁盘驻留向量搜索的流形一致图索引

Dongfang Zhao

机构 * Tacoma School of Engineering and Technology(塔科马工程与技术学院) Paul G. Allen School of Computer Science & Engineering(保罗·G·艾伦计算机科学与工程学院) University of Washington(华盛顿大学)

AI总结 本文提出MCGI,一种基于流形一致性的图索引方法,通过动态调整搜索策略以适应数据内在几何结构,提升高维空间下的近邻搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏