REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
REVISOR:超越文本反思,迈向长视频理解的多模态反思推理
机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) ; Renmin University of China(中国人民大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 REVISOR通过多模态反思框架提升长视频理解能力,解决纯文本反思在动态视觉输入和跨模态交互上的不足,采用Dual Attribution Decoupled Reward机制增强因果对齐,无需额外监督微调即在多个基准测试中取得优异成绩。