How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理
机构 * Mila - Québec AI Institute(蒙特利尔AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; ServiceNow AI Research(ServiceNow人工智能研究) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 提出View Dropout训练策略使模型利用中间思维图像进行跨视角空间推理,并发现全景视觉思维在信息性和可学习性上最优。
Comments Preprint