The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model
中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构
机构 * Vanderbilt University(范德堡大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; National Center for Supercomputing Applications(国家超级计算应用中心)
专题命中 偏好对齐 :RLHF(title,title_cn);alignment(title,abstract);分类 cs.CL
AI总结 研究RLHF对Llama 3.1 8B党派倾向的影响,发现RLHF仅压缩党派信号方差以实现中性输出,而非移除党派结构,且特征级操控可绕过对齐。