DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models
DeepThinkVLA: 提升视觉-语言-动作模型的推理能力
Cheng Yin, Yankai Lin, Wang Xu, Sikyuen Tam, Xiangrui Zeng, Zhiyuan Liu, Zhouping Yin
机构
*
Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系)
;
Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院)
;
Beijing Zhongguancun Academy, China(北京中关村学院)