Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
带有观测校准自蒸馏的智能体强化学习
机构 * Meituan(美团)
AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。
大厂专区
带有观测校准自蒸馏的智能体强化学习
机构 * Meituan(美团)
AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。