DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型
机构 * Shanghai Qi Zhi Institute(上海启智研究院) ; Tsinghua University(清华大学) ; Tongji University(同济大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV
AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。
Comments arXiv admin note: text overlap with arXiv:2605.21273