FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization
FlowPRO:通过近端偏好优化对流匹配VLA进行无奖励强化微调
机构 * Tencent Robotics X(腾讯机器人X实验室) ; Futian Laboratory(福田实验室) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)
AI总结 提出FlowPRO框架,通过近端偏好优化(RPRO)和干预-回滚数据收集方法,实现无奖励的离线强化微调,在四类长时程双臂任务中取得最高成功率。