Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
Faithful-MR1: 通过锚定和强化视觉注意力实现忠实的多模态推理
机构 * AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出Faithful-MR1框架,通过锚定和强化视觉注意力解决多模态推理中的忠实性问题,提升模型在多模态基准上的表现。
Comments 20 pages, 7 figures, 3 tables. Preprint