LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering
大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见
机构 * York University(约克大学) ; Vector Institute(向量研究所) ; Connected Minds(连接思维公司) ; Emory University(埃默里大学) ; Wilfrid Laurier University(威尔弗里德·劳里埃大学) ; University of Toronto(多伦多大学) ; University of Guelph(圭尔夫大学) ; Monark Health(莫纳克健康公司) ; CIFAR Solution Network(加拿大高级研究院解决方案网络)
AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。