CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成
机构 * Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; United Nova Technology(联合Nova技术) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。