Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
从多模态大语言模型中榨取能力用于主题驱动生成
机构 * University of Toronto & Vector Institute(多伦多大学及向量研究所) ; Adobe(Adobe公司) ; Google(谷歌公司)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 提出一种结合多模态大语言模型和VAE身份条件的方法,通过双层级聚合模块和多阶段去噪策略,在主题驱动图像生成中实现多模态理解与身份保持的平衡,优于现有方法。
Comments 33 pages, 18 figures, Project Page: https://zsh2000.github.io/squeeze-mllm-subject-gen/