ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples
ARMOR:使用离策略锚样本稳定在线大语言模型强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Dartmouth College(达特茅斯学院)
AI总结 研究大语言模型强化学习训练不稳定问题,提出ARMOR框架,通过锚展开利用离策略数据保留解决方案模式,混合优化重新制定策略目标实现可控探索,经实验验证可有效减轻验证崩溃,提升性能。