arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-07-31 至 2026-07-31 共收录 2
2607.26991 2026-07-31 cs.RO 版本更新

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

RL²-VLA:面向视觉-语言-动作模型的测试时缩放自适应RL隐成分引导

Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) Singapore Technologies Engineering(新加坡科技工程公司)

AI总结 针对VLA模型分布外任务性能下降问题,提出基于VLA隐空间的自适应推理时引导框架RL²,仅在预测失败时激活成分引导,在SIMPLER等基准上分布外成功率最高提升17.3%,可迁移至真实世界。

Comments Code and models are available at https://rl2-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏