DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
DualCoT-VLA: 通过并行推理实现视觉-语言链式思维的视觉-语言-动作模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Huawei Foundation Model Department(华为基础模型部门)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV、cs.RO
AI总结 DualCoT-VLA通过并行推理机制,结合视觉和语言链式思维,解决传统VLA模型在复杂多步骤任务和精细空间感知中的不足,实现更高效的视觉-语言-动作处理。