Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Study
对齐减少了表达但未减少编码的性别偏见:一个统一的框架和研究
机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) ; AXA(安盛) ; Polish Academy of Science, IBS PAN(波兰科学院、IBS PAN)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出统一框架分析LLM中的内在和外在性别偏见,发现对齐减少表达偏见但内部表示仍存在关联,且在对抗性提示下可被激活。