Reinforcing the Generation Order of Multimodal Masked Diffusion Models
强化多模态掩码扩散模型的生成顺序
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; AGI Foundations for AWS(AWS强化人工智能基础)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)
AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。