WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习
专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。
Comments 25pages, 11 figures