Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs
推理即交集:视频多模态大语言模型中视觉焦点的一致性帧对齐
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Cloud and AI BU, Huawei(华为云与AI业务部) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出无时间标注的过程级奖励框架CF-GRPO,通过视频内在线索构建一致性帧先验,并利用一致性帧奖励优化模型帧使用与先验的对齐,提升视频推理性能。