R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
R-C2:循环一致性强化学习提升多模态推理
机构 * Rutgers University(罗格斯大学) ; Columbia University(哥伦比亚大学) ; University of Chicago(芝加哥大学)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 R-C2通过循环一致性强化学习解决多模态推理中的内部冲突,提升推理准确率7.6个百分点。