From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
从感知到思考:解耦感知与推理提升视觉语言模型的训练
机构 * Amazon(亚马逊) ; University of Waterloo(滑铁卢大学) ; Vector Institute, Canada CIFAR AI Chair(向量研究所,加拿大CIFAR人工智能主席)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,comments);visual reasoning(abstract);分类 cs.CV
AI总结 本研究通过解耦感知与推理,发现视觉任务性能受限于感知能力不足而非推理本身,通过分阶段训练提升模型的感知与推理能力,从而在多个视觉数学和感知任务中取得更优表现。
Comments 19 pages, 9 figures; Accepted to ICML 2026; Project Page: https://ucsc-vlaa.github.io/VLM-CapCurriculum/