Bi-VLA: Bilateral Control-Based Imitation Learning via Vision-Language Fusion for Action Generation
Masato Kobayashi, Thanpimon Buamanee
机构
*
D3 Center, The University of Osaka(大阪大学D3中心)
;
Graduate School of Information Science and Technology, The University of Osaka(大阪大学信息科学与技术研究生院)
;
Graduate School of Maritime Sciences, Kobe University(兵库大学海运研究生院)
Comments8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness
机构
*
Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院)
;
Everwise-Tech Co., Ltd.(恒智慧科技有限公司)
;
Tongji University(同济大学)
;
Fudan University(复旦大学)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
East China University of Science and Technology(华东理工大学)
;
Huawei Celia Team(华为Celia团队)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
OpenHelix Robotics