EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距
Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong
机构
*
Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
;
Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))
机构
*
Center for Basic Research on Materials(材料基础研究中心)
;
National Institute for Materials Science(国家材料科学研究所)
;
Graduate School of Frontier Sciences(前沿科学研究生院)
;
The University of Tokyo(东京大学)
;
RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)
;
Core Facility Center(核心设施中心)
;
Tohoku University(东北大学)
;
Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学)
;
CNRS(法国国家科学研究中心)
;
Grenoble INP(格勒诺布尔INP)
;
SIMaP
;
Center for Green Research on Energy and Environmental Materials(能源与环境材料绿色研究中心)
;
Nara Institute of Science and Technology(奈良科学技术大学)
;
Research Center for Structural Materials(结构材料研究中心)
;
Graduate School of Medical Life Science(医学生命科学研究生院)
;
Tokyo Institute of Technology(东京技术大学)