The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling
压缩间隙:为什么离散标记化限制了视觉-语言-动作模型的扩展
机构 * Shibattic Inc.
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文探讨了在视觉-语言-动作模型中,离散标记化导致的压缩间隙问题,指出信息瓶颈的位置决定了模型扩展效果,而非统一增加模型或数据规模。
Comments 11 pages, 1 figure