GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models
GRPO与反思奖励在大语言模型数学推理中的应用
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。
Journal ref Applied and Computational Engineering 154 161-166 (2025)