Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models
推理是否保持对齐?关于大型推理模型的可信度研究
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) ; University of Central Florida(中佛罗里达大学) ; University of Maryland College Park(马里兰大学帕克分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :LLM(abstract_cn);post-training(abstract);分类 cs.CL
AI总结 研究通过监督微调、强化学习和蒸馏生成的推理模型在安全、偏见、隐私等六个可信度维度上是否保持对齐,发现推理模型常出现对齐退化,如毒性增加、刻板印象加剧等。