Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups
探究中文大语言模型中的社会身份偏见:基于性别代词与社会群体
机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 通过设计考虑中文语言特性的提示,评估十种代表性中文大语言模型在240个社会群体上的内群体与外群体框架下的情感和毒性偏见,发现系统性不对称且指令调优减少情感偏见但毒性差距更持久,女性标记代词与更高毒性相关。