A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
一种基于共识的大语言模型相对偏好评估框架
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。
Comments 14 pages, 7 figures