CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成
机构 * Zhejiang University, China(浙江大学)
专题命中 VLM训练与架构 :MLLM(title,title_cn);分类 cs.CV
AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。
Comments ICML 2026