Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
通过中间结构预测分解主体驱动的图像生成
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV
AI总结 该研究提出了一种两阶段框架,通过先预测Canny图再基于源外观和预测结构生成最终图像,以解决主体驱动文本到图像生成中高频率身份细节如logo、图案和文本的保留问题,并通过自动管道构建了10万对文本感知数据集,实验结果表明中间结构预测能有效提升高保真主体驱动生成的性能。