Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li
机构
*
Shanghai Qizhi Institute(上海期智研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Hong Kong Embodied AI Lab(香港具身人工智能实验室)
;
Tsinghua University(清华大学)
;
University of California, Berkeley(加州大学伯克利分校)
Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom
机构
*
Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系)
;
Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系)
;
Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)
LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries
LangForce: 通过潜在动作查询对视觉语言动作模型进行贝叶斯分解
Shijie Lian, Bin Yu, Xiaopeng Lin, Laurence T. Yang, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Cong Huang, Kai Chen
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Beijing Zhongguancun Academy(北京中关村学院)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Zhengzhou University(郑州大学)
;
Beihang University(北航)
;
East China Normal University(东华大学)
;
DeepCybot Co., Ltd.(DeepCybot有限公司)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型
Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan
机构
*
Zhejiang University(浙江大学)
;
Amap, Alibaba Group(阿里集团阿地图)
;
Nanjing University(南京大学)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
;
Beijing University of Chemical Technology(北京化工大学)
;
Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室)
;
Tsinghua University(清华大学)
;
Queen Mary University of London(伦敦大学玛丽女王学院)