arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-08-06 至 2026-08-06 共收录 1
2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏