When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger
当弱大语言模型自信发言时,偏好对齐会变得更强大
机构 * EPFL(苏黎世联邦理工学院) ; Sharif University of Technology(谢赫·穆吉加布大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。
Comments 32 pages, 8 figures, International Conference on Learning Representations 2026