Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
视频主动感知:基于视觉-语言模型的高效推理时长视频理解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院)
AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。
Comments ICCV 2025 workshop