The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works
奖励通道中的暗室:密集预测奖励使GRPO训练的大语言模型智能体崩溃——以及实际有效的方法
专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG
AI总结 研究发现密集预测奖励在GRPO训练下会使大语言模型智能体崩溃,通过单因素消融定位原因,提出方差分布标准,还通过受控信号传递矩阵对比奖励通道和辅助损失通道,表明奖励通道至多中性,辅助损失通道有优势。