arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ServiceNow

2026-05-27 至 2026-05-27 共收录 1
2605.27310 2026-05-27 cs.CV

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理

Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(蒙特利尔AI研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) ServiceNow AI Research(ServiceNow人工智能研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 提出View Dropout训练策略使模型利用中间思维图像进行跨视角空间推理,并发现全景视觉思维在信息性和可学习性上最优。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏