Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning
基于离线强化学习的代码生成LLM高效后训练
机构 * Hessian Center for Artificial Intelligence(海德堡人工智能中心) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);分类 cs.AI
AI总结 本文探索使用离线强化学习利用现有代码数据集对代码生成LLM进行后训练,实验表明该方法能有效提升模型性能,尤其适用于小模型和复杂编码问题。