Comments8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset
VGI-BENCH: Probing Visual Intelligence in Video Generation Models
VGI-BENCH:探究视频生成模型的视觉智能
Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai
机构
*
University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Tsinghua University(清华大学)
;
University of Waterloo(滑铁卢大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute(矢量研究所)
;
Microsoft Research(微软研究院)
;
Etude AI