Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理
机构 * Fudan University(复旦大学) ; Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) ; Future Living Lab of Alibaba(阿里巴巴未来生活实验室) ; University of Southern California(南加州大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。
Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026