High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。