Lower-Resource, Higher Scores: Language Bias in LLM Evaluators
语言模型评估器在不同语言间存在偏差
机构 * University of Cambridge(剑桥大学) ; Language Technology Lab(语言技术实验室)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL
AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。