Scaling Spatial Intelligence with Multimodal Foundation Models
通过多模态基础模型提升空间智能
机构 * SenseTime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。
Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026