Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; Wuhan University(武汉大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化研究所) ; University of Tokyo(东京大学) ; University of Liverpool(利物浦大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; UC Merced(加州大学默塞德分校)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。