VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; South China Normal University(华南师范大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Defense Technology(国防科技大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV
AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。
Comments 27 pages, 8 figures