When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性
机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) ; Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) ; School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)
AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。
Comments 6 pages, 6 figures, 4 tables