Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
重新审视视觉-语言-动作模型的实用性:一个全面的基准和一个改进的基线
机构 * OpenHelix-Team(OpenHelix团队)
专题命中 GUI与屏幕智能体 :VLM(abstract);LLaVA(abstract)
AI总结 本文提出CEbench基准和LLaVA-VLA模型,通过轻量级设计和两阶段训练提升视觉-语言-动作模型的实用性,实现在消费级GPU上的实际应用。
Comments Accepted by ICRA 2026