See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding
看得更多,思考更深:面向长视频理解的查询扩展视觉证据与答案线索引导反思
机构 * Baidu Inc.(百度公司) ; Harbin Institute of Technology(哈尔滨工业大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(title);分类 cs.CV
AI总结 提出CoVER框架,通过动态收集查询扩展视觉证据和答案特定视觉反馈验证草稿答案,实现从答案中心生成到证据中心和视觉可验证推理的转变,在长视频理解任务上超越同规模模型及部分闭源模型。