SKATE, a Scalable Tournament Eval: Weaker LLMs differentiate between stronger ones using verifiable challenges
SKATE,一种可扩展的锦标赛评估:较弱的LLM通过可验证的挑战区分更强的LLM
机构 * The Alan Turing Institute(阿尔文·图灵研究所) ; University of Cambridge(剑桥大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Independent(独立研究者)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 SKATE通过让LLM相互生成和解决可验证任务,实现可扩展的评估框架,揭示模型间的细微能力差异。
Comments 7 pages and appendices