IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
IV-CoT: 面向结构感知文本到图像生成的隐式视觉思维链
机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; Ant Group(蚂蚁集团) ; The University of Hong Kong(香港大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV
AI总结 提出隐式视觉思维链(IV-CoT)框架,通过结构到语义的级联分解和训练时草图监督,在不增加推理开销的情况下提升文本到图像生成的结构感知能力。