VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
VLA-OPD: 通过在线策略蒸馏连接离线SFT与在线RL以构建视觉-语言-动作模型
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出VLA-OPD框架,通过在线策略蒸馏结合离线SFT与在线RL,解决预训练模型在部署中的分布偏移和灾难性遗忘问题,提升样本效率与鲁棒性。