It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO
一个样本就能带偏所有:单次GRPO打破对齐
机构 * University of Michigan(密歇根大学) ; Northwestern University(西北大学)
AI总结 研究发现,仅用单个有偏样本进行一步GRPO训练就能诱导大语言模型产生系统性偏见,且刻板印象推理泛化到多种属性、类别和基准测试,揭示了对齐机制的关键脆弱性。
Comments COLM 2026