arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Oracle(甲骨文)

2026-07-14 至 2026-07-14 共收录 1
2607.09739 2026-07-14 cs.AI cs.CL 新提交

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择

Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Oracle(甲骨文公司) Together AI(Together AI公司) LMSYS NVIDIA(英伟达公司)

AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。

详情

展开后加载摘要…

URL PDF HTML 收藏