What Matters in Building Vision-Language-Action Models for Generalist Robots
在通用机器人中构建视觉-语言-动作模型所关注的关键因素
Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu
机构
*
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
ByteDance Research(字节跳动研究院)
;
CASIA MAIS-NLPR
;
Shanghai Jiao Tong University(上海交通大学)
;
National University of Singapore(新加坡国立大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
机构
*
AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学)
;
Anyverse Dynamics
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
;
Terminal Technology Department, Alipay, Ant Group(终端技术部,蚂蚁集团)
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院)
;
CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心)
;
Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
ActionFlow:面向边缘设备的视觉语言模型流水线动作加速
Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou
机构
*
School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学)
;
Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学)
;
IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)
机构
*
Lanzhou University, China(兰州大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)
;
NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)
OpenVLA: An Open-Source Vision-Language-Action Model
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti, Ted Xiao, Ashwin Balakrishna, Suraj Nair, Rafael Rafailov, Ethan Foster, Grace Lam, Pannag Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, Chelsea Finn
PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
面向通用视觉-语言-动作策略的通用姿态预训练
Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu
机构
*
Tencent Robotics X(腾讯机器人X)
;
Futian Laboratory(福田实验室)
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)