SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation
信息播种:利用大规模语言模型在图像生成中培养上下文一致性
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。
Comments Project page: https://pyh-129.github.io/SOW/