More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
更多思考,更少准确性?关于视觉-语言模型中推理的双重性质
机构 * Australian National University(澳大利亚国立大学) ; University of Melbourne(墨尔本大学) ; GE Research(GE全球研究院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究揭示了视觉-语言模型中推理的双重性质:虽然增强了逻辑推理能力,但可能导致感知基础能力下降,通过提出VAPO方法改进了模型对视觉信息的依赖。
Comments Accepted to ICLR2026