Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding
Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)
AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。
Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available