Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation
让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者
机构 * Peking University(北京大学) ; hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) ; MMLab, CUHK(香港中文大学 MMLab) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。
Comments arXiv admin note: substantial text overlap with arXiv:2509.15772