ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
ReMoRa:基于精细运动表示的多模态大语言模型用于长视频理解
机构 * Keio University(庆应大学) ; NII(日本信息处理学会) ; NII LLMC(日本信息处理学会语言模型中心)
专题命中 视觉问答 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 ReMoRa通过精细运动表示实现长视频理解,有效压缩视频数据并提升多模态大语言模型性能。
Comments Accepted to CVPR 2026