League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
语言模型联盟:一种无需基准的多轮相互评估范式
Qianhong Guo, Wei Xie, Xiaofang Cai, Enze Wang, Shuoyoucheng Ma, Xiaobing Sun, Tian Xia, Kai Chen, Xiaofeng Wang, Baosheng Wang
机构
*
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Institute of High Performance Computing, A*STAR(A*STAR高性能计算研究所)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结
本文提出无需基准的语言模型评估范式League of LLMs,通过多轮相互评估区分模型能力并保持高稳定性,揭示传统方法难以捕捉的实证发现。
机构
*
Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学)
;
Huawei Large Model Data Technology Lab(华为大模型数据技术实验室)
;
Cornell University(康奈尔大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
University of Edinburgh(爱丁堡大学)
;
UCL(伦敦大学学院)
;
CUHK (SZ)(香港中文大学(深圳))
;
SUTD(新加坡科技设计大学)
;
HKUST(香港科技大学)
;
CUHK(香港中文大学)
;
HKUST (GZ)(香港科技大学(广州))
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
College of Computer Science
;
Technology, National University of Defense Technology, Changsha, Hunan, China
;
State Key Laboratory of Complex \& Critical Software Environment, Changsha, Hunan, China
;
National Key Laboratory of Parallel
;
School of Humanities
;
Social Sciences, School of Public Administration, Beihang University, Beijing, China
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI