HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving
HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型
机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。
Comments 20 pages with 13 figures