CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
CFPO:用于多模态推理的反事实策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。
Comments Accepted to ICML 2026. 17 pages