Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; BAAI(北京人工智能研究院)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.CV、cs.AI
AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。