CommentsAccepted at BMVC 2022. It includes the supplementary material. The margins and page size were modified to fit the arXiv ID stamp on the left side
Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)