Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment
学习诊断和纠正错误:大型语言模型中的道德敏感性获取
机构 * University of Mississippi(密西根州立大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; AWS AI Labs(AWS AI实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Qualcomm(高通) ; Michigan State University(密西根州立大学) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。