ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
ReFoCUS: 用于上下文理解的强化引导帧优化
机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
AI总结 提出ReFoCUS框架,首次将在线策略梯度强化学习集成到视频大语言模型的帧级优化中,通过自回归和查询条件选择架构学习帧选择策略,无需显式帧级监督,提升视频问答推理准确性。
Comments Project page: https://interlive-team.github.io/ReFoCUS/