Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线
机构 * OpenHelix-Team(OpenHelix团队)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO
AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。
Comments Accepted by ICRA 2026