Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective
在弱到强对齐中评估风险:从偏差-方差视角出发
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; InstaDeep ; New York University(纽约大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。