2601.03079
2026-08-06
cs.CL
版本更新
Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment
学习诊断和纠正错误:大型语言模型中的道德敏感性获取
Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu
机构
*
University of Mississippi(密西根州立大学)
;
Nanyang Technological University(南洋理工大学)
;
Northeastern University(东北大学)
;
AWS AI Labs(AWS AI实验室)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Qualcomm(高通)
;
Michigan State University(密西根州立大学)
;
Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
AI总结
提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。