ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation
ELAN4D:以具身为中心的4D监督用于视觉-语言-动作模型的即插即用适配
Zeyuan He, Bowen Yang, Zhirui Fang, Keru Zhou, Lei Jiang, Jingjing Qian, Fan Mo, Junchi Yan, Philip Torr, Xiu Li, Li Jiang, Jialin Yu
机构
*
Torr Vision Group, University of Oxford(托尔视觉组,牛津大学)
;
The Chinese University of Hong Kong, Shenzhen(香港大学(深圳))
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University College London(伦敦大学学院)
;
University of Cambridge(剑桥大学)
LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解
Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Beijing Zhongguancun Academy(北京中关村学院)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Zhengzhou University(郑州大学)
;
Beihang University(北航)
;
East China Normal University(东华大学)
;
DeepCybot Co., Ltd.(DeepCybot有限公司)