arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

2026-05-20 至 2026-05-20 共收录 4
2605.20040 2026-05-20 cs.LG

Active Context Selection Improves Simple Regret in Contextual Bandits

主动上下文选择提升上下文老虎机中的简单遗憾

Mohammad Shahverdikondori, Jalal Etesami, Negar Kiyavash

机构 * College of Management of Technology, EPFL(EPFL技术管理学院) Department of Computer Science, TU Munich(慕尼黑工业大学计算机科学系)

AI总结 本文研究了具有有限上下文空间的上下文多臂老虎机问题,通过主动选择上下文样本来优化简单遗憾,提出了一种在已知和未知上下文分布时均能有效提升性能的算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19377 2026-05-20 cs.LG cs.AI

The Evaluation Game: Beyond Static LLM Benchmarking

评估游戏:超越静态LLM基准测试

Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec, Vincent Corruble

机构 * Sorbonne Université, CNRS, LIP6(索邦大学,国家科学研究中心,LIP6实验室) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

AI总结 本文提出了一种基于博弈论的框架,用于评估大型语言模型的安全性,通过数据增强的群作用结构分析评估者与训练者之间的互动,揭示了对抗性测试中局部泛化和记忆补丁的区别。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19141 2026-05-20 cs.LG cs.AI cs.CL cs.CY cs.HC

GRASP: Deterministic argument ranking in interaction graphs

GRASP:交互图中的确定性论证排名

Diganta Misra, Antonio Orvieto, Rediet Abebe, Volkan Cevher

机构 * MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所) Eberhard Karls Universität Tübingen(图宾根埃伯哈德·卡尔斯大学) LIONS, EPFL(EPFL的LIONS实验室)

AI总结 本文提出GRASP框架,通过聚合稳定的局部交互判断生成全局排名,以解决大语言模型作为裁判时整体评判不一致的问题,强调结构充分性而非说服力或修辞吸引力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18191 2026-05-20 eess.SP cs.AI cs.LG cs.PF

Quantifying the Generalization Gap in Seizure Detection: A Large-Scale Empirical Benchmark via the SzCORE Challenge

量化癫痫检测中的泛化差距:通过SzCORE挑战进行大规模经验基准测试

Jonathan Dan, Amirhossein Shahbazinia, Christodoulos Kechris, David Atienza

机构 * Embedded Systems Laboratory, EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院嵌入式系统实验室)

AI总结 本文通过SzCORE挑战的大规模经验研究,量化了癫痫检测中模型泛化能力的差距,评估了28种最先进的算法架构,揭示了当前模型在不同患者群体中表现不一致的问题,并提出了标准化评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏