Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning
LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Microsoft Research(微软研究院) ; University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学) ; CUHKSZ(香港中文大学(深圳)) ; THU(清华大学)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。