Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Texas A&M University(德州农工大学) ; University of California, Irvine(加州大学欧文分校)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。
Comments Code: https://github.com/dwipddalal/Anchor-Align