Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
带有观测校准自蒸馏的智能体强化学习
机构 * Meituan(美团)
AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。
大厂专区
带有观测校准自蒸馏的智能体强化学习
机构 * Meituan(美团)
AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。
蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证
机构 * Meituan LongCat Interaction(美团龙猫交互) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Jilin University(吉林大学) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。
Comments 15 pages, 5 figures