JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation
JudgeArena:用于可复现LLM-评判者评估的统一框架
机构 * University of Freiburg(弗莱堡大学) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Microsoft AI(微软人工智能部门) ; Cohere Labs(Cohere实验室) ; Prior Labs(Prior实验室)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。