Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models
增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉
机构 * Zhejiang University(浙江大学) ; University of Toronto(多伦多大学) ; Dalian University of Technology(大连理工大学) ; Sun Yat-sen University(中山大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。
Comments Preprint