MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
East China University of Science and Technology(华东理工大学)
;
Huawei Celia Team(华为Celia团队)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
OpenHelix Robotics
机构
*
DataArc Tech Ltd.(DataArc科技有限公司)
;
IDEA Research(IDEA研究院)
;
International Digital Economy Academy(国际数字经济学院)
;
School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院)
;
Institute of Computing Technology, CAS(中国科学院计算技术研究所)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
OmniUMI: Towards Physically Grounded Robot Learning via Human-Aligned Multimodal Interaction
OmniUMI: 通过人对齐的多模态交互实现物理基础的机器人学习
Shaqi Luo, Yuanyuan Li, Youhao Hu, Chenhao Yu, Chaoran Xu, Jiachen Zhang, Guocai Yao, Tiejun Huang, Ran He, Zhongyuan Wang
机构
*
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Beijing Institute of Technology(北京理工大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy
MATT-Diff:基于扩散策略的多模态主动目标跟踪
Saida Liu, Nikolay Atanasov, Shumon Koga
机构
*
Department of Computer Science and Systems Engineering, Kobe University(神户大学计算机科学与系统工程系)
;
Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)