Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding
生成模型了解空间:解锁隐式3D先验用于场景理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Baidu Inc.(百度公司)
AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。
Comments Accepted by ECCV 2026