Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding
基于证据的关键帧采样用于基于MLLM的长视频理解
机构 * Duke University(杜克大学) ; Independent Researcher(独立研究员)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出基于信息瓶颈理论的证据驱动关键帧采样框架,通过最大化选帧与查询的条件互信息,提升长视频理解性能,实验表明在严格token预算下优于现有方法。