ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models
ETA-VLA:通过时间融合和内在LLM稀疏化实现高效标记适应的视觉-语言-动作模型
机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究,博世(中国)投资有限公司) ; School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院)
专题命中 多传感器融合 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 本文提出ETA-VLA框架,通过时间融合和内在LLM稀疏化技术,减少视觉-语言-动作模型的计算负担,实验表明在保持高精度的同时,显著降低计算量。