FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation
FORCE: 通过值校准预热和自蒸馏实现高效的VLA强化学习微调
机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)
AI总结 提出FORCE框架,通过值校准预热和自蒸馏解决VLA模型RL微调中的样本效率低和初始遗忘问题,在仿真和真实任务中成功率提升79%,训练加速32.5%。