Language Models that Think, Chat Better
能思考、对话更出色的语言模型
机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) ; Princeton University(普林斯顿大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);DPO(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型
Comments COLM 2026; we release our code, data, and artifacts publicly at this https URL (https://github.com/princeton-pli/RLMT)