Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation
从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡
机构 * York University Canada(加拿大约克大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.AI
AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。
Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026