arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-04-29 至 2026-04-29 共收录 5
2604.25580 2026-04-29 cs.CL

Bye Bye Perspective API: Lessons for Measurement Infrastructure in NLP, CSS and LLM Evaluation

再见视角API:NLP、CSS和LLM评估中的测量基础设施教训

David Hartmann, Manuel Tonneau, Angelie Kraft, LK Seiling, Dimitri Staufer, Pieter Delobelle, Jan Fillies, Anna Ricarda Luther, Jan Batzner, Mareike Lisker

机构 * Weizenbaum Institute(韦izenbaum研究所) TU Berlin(柏林技术大学) University of Oxford(牛津大学) KU Leuven(根特大学) Pleias(Pleias公司) Freie Universität Berlin(柏林自由大学) University of Bremen(不莱梅大学) ifib research(ifib研究) TU Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) HTW Berlin(柏林应用技术大学) University of Hamburg(汉堡大学)

AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。

Comments 13 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06723 2026-04-29 eess.IV cs.CV cs.LG

Evaluating Computational Pathology Foundation Models for Prostate Cancer Grading under Distribution Shifts

评估计算病理学基础模型在前列腺癌分级下的分布偏移鲁棒性

Fredrik K. Gustafsson, Mattias Rantalainen

机构 * Department of Medical Epidemiology and Biostatistics, Karolinska Institutet(卡罗林斯卡研究所医学流行病学与生物统计学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

AI总结 本文评估了计算病理学基础模型在前列腺癌分级中的鲁棒性,发现跨机构转移时性能显著下降,表明大规模预训练不足以保证下游泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.12922 2026-04-29 math.PR cs.LG stat.ML

On quantitative Laplace-type convergence results for some exponential probability measures, with two applications

关于某些指数概率测度的定量拉普拉斯型收敛结果及其两个应用

Valentin De Bortoli, Agnès Desolneux

机构 * Department of Statistics, University of Oxford, UK(英国牛津大学统计系) Centre Borelli, CNRS and ENS Paris-Saclay, France(法国CNRS与ENS巴黎-萨克雷大学博雷利中心)

AI总结 本文研究了指数势函数下的测度序列收敛性,建立了Wasserstein距离下的定量界,并应用于最大熵模型和SGLD算法在低温下的收敛性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25415 2026-04-29 q-bio.NC cs.AI cs.HC

One-shot emergency psychiatric triage across 15 frontier AI chatbots

在15个前沿AI聊天机器人上进行一次紧急精神病科分诊

Veith Weilnhammer, Lennart Luettgau, Christopher Summerfield, Viknesh Sounderajah, Elise Wilkinson, Virginia Corno, Matthew M Nour

机构 * Max Planck UCL Centre for Computational Psychiatry and Ageing Research(马克斯·普朗克大学伦敦计算精神病学与衰老研究中心) UK AI Security Institute(英国人工智能安全研究所) Department of Experimental Psychology, University of Oxford(牛津大学实验心理学系) Microsoft AI(微软人工智能) Department of Psychiatry, University of Oxford(牛津大学精神病学系)

AI总结 研究评估了15个前沿AI聊天机器人在精神病科分诊中的表现,发现其在高风险情况下的准确率较高,但对低风险情况存在明显过度分诊的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03426 2026-04-29 cs.LG math.ST stat.ML stat.TH

Sharp Risk Bounds for Early-Stopping in Gaussian Linear Regression

高维高斯线性回归中早停镜像下降法的风险界

Tobias Wegel, Gil Kur, Patrick Rebeschini

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系) Department of Statistics, University of Oxford(牛津大学统计系)

AI总结 研究高维高斯线性回归中早停镜像下降法的最优风险界,基于局部高斯宽度推导出LSE的风险界扩展,提出Minkowski函数条件下的新势能构造方法,实现ESMD的minimax最优性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏