MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang
机构
*
Westlake University(西湖大学)
;
Zhejiang University(浙江大学)
;
East China University of Science and Technology(华东理工大学)
;
Huawei Celia Team(华为Celia团队)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
OpenHelix Robotics
Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA
Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略
Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
;
University of Electronic Science and Technology of China(电子科技大学)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
StereoVLA:利用立体视觉增强视觉-语言-动作模型
Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang
机构
*
Galbot
;
CFCS, School of CS, Peking University(北京大学计算机学院CFCS)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
The University of Hong Kong(香港大学)
;
Xiamen University Malaysia(厦门大学马来西亚分校)
;
Southern University of Science and Technology(南方科技大学)
CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models
CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型
Khoa Vo, Sieu Tran, Taisei Hanyu, Yuki Ikebe, Duy Nguyen, Nghi D. Q. Bui, Minh Vu, Anthony Gunderman, Chase Rainwater, Anh Nguyen, Ngan Le
机构
*
University of Arkansas(亚拉巴马大学)
;
Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学)
;
Center of AI Research, VinUniversity(Vin大学人工智能研究中心)
;
TU Wien(维也纳技术大学)
;
University of Liverpool(利物浦大学)