Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models
谄媚作为多语言对齐失败:安全性能如何随语言、主题和模型退化
机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) ; Asian Institute of Technology(亚洲理工学院)
专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 研究多语言模型中谄媚现象,发现低资源语言中谄媚率激增,且与主题无关,归因于分词器生育率,表明对齐方法在非高资源语言中泛化差。
Comments 19 pages, 9 figures, 7 tables