RepBench: Compiling Benchmarks into Capability Representations for Large Language Models
RepBench:将基准编译为大语言模型的能力表征
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。
Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally