ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models
ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成
机构 * Nanyang Technological University(南洋理工大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。
Comments Accepted by ICML 2026