ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型
机构 * Zhejiang University(浙江大学) ; Amap, Alibaba Group(阿里集团阿地图) ; Nanjing University(南京大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; Beijing University of Chemical Technology(北京化工大学) ; Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) ; Tsinghua University(清华大学) ; Queen Mary University of London(伦敦大学玛丽女王学院)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。