RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models
RL²-VLA:面向视觉-语言-动作模型的测试时缩放自适应RL隐成分引导
机构 * National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; Singapore Technologies Engineering(新加坡科技工程公司)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 针对VLA模型分布外任务性能下降问题,提出基于VLA隐空间的自适应推理时引导框架RL²,仅在预测失败时激活成分引导,在SIMPLER等基准上分布外成功率最高提升17.3%,可迁移至真实世界。
Comments Code and models are available at https://rl2-vla.github.io