SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance
SA-VLA: 状态感知分词器提升视觉-语言-动作模型性能
机构 * Shanghai Jiao Tong University(上海交通大学) ; East China University of Science and Technology(东华大学) ; Hong Kong Polytechnic University(香港理工大学) ; Xi’an University of Electronic Science and Technology(西安电子科技大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出状态感知动作分词器SA-VLA,通过状态条件动作解码减少离散化压缩损失,在12个操作任务上将成功率从0.29提升至0.56。