MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测
Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)
;
Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid))
;
The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))
CommentsIn Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2018) Workshop "Towards Robots that Exhibit Manipulation Intelligence", Madrid, Spain, Oct. 1, 2018
机构
*
Sun Yat-sen University(中山大学)
;
Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室)
;
X-Era AI Lab(X-Era人工智能实验室)
;
AMAP, Alibaba(阿里妈妈实验室)
;
Guangdong University of Technology(广东工业大学)
Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation
Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作
Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao
机构
*
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院)
;
Yuanpei College, Peking University(北京大学元培学院)
;
Department of Automation, Tsinghua University(清华大学自动化系)
ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation
ConLA:从人类视频中通过对比学习学习机器人操作
Weisheng Dai, Kai Lan, Jianyi Zhou, Bo Zhao, Xiu Su, Junwen Tong, Weili Guan, Shuo Yang
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳))
;
ZTE Corporation(中兴通讯)
;
Shanghai Jiao Tong University(上海交通大学)
;
Central South University(中南大学)