Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs
视角转换:用于LLM中鲁棒偏见缓解的引导向量
机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; AMPLYFI
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过引导向量修改模型激活以缓解LLM中的偏见,通过8个社会偏见轴(如年龄、性别、种族)在BBQ数据集子集上计算引导向量,并在四个数据集上比较其与三种其他偏见缓解方法的效果,展示其在减少偏见方面的有效性。
Comments Published to EACL Findings 2026