How far can bias go? Tracing bias from pretraining data to alignment
偏见能走多远?从预训练数据到对齐的偏见追溯
机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ; ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 AI治理与伦理 :alignment(title);分类 cs.CL
AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。