Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
从多模态大语言模型中榨取能力用于主题驱动生成
机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) ; Adobe(Adobe公司) ; Google(谷歌公司)
专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV、cs.GR、cs.MM
AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。
Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/