TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Technologies Co. Ltd(华为技术有限公司)
AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。
Comments Code is available at https://github.com/H-EmbodVis/TurboVLA