The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs
错误的正确:量化和定位大语言模型中的失调对齐
机构 * University of Michigan(密歇根大学) ; University of Cambridge(剑桥大学) ; University of Aberdeen(阿伯丁大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。