CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model
CoTinyVLA:用于十亿参数以下视觉-语言-动作模型的思维链蒸馏
机构 * Chung-Ang University(韩国中央大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.AI
AI总结 研究针对VLA模型内存需求大问题,提出CoTinyVLA模型。通过双视图时间输入、分层思维链蒸馏、释义增强三个组件,在LIBERO-Plus基准测试中取得优异成绩,证明结构化监督可让小参数主干超越其他模型。
Comments 22 pages, 2 figures, 20 tables. Code at https://github.com/BrainJellyPie/CoTinyVLA