Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation
照亮统一多模态模型以实现自由形式交错文本-图像生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) ; Nankai University(南开大学)
专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV
AI总结 提出ILLUME-X统一多模态模型,通过改进数据效率和稳定训练,实现高质量自由形式交错文本-图像生成,在风格迁移等任务上超越先前模型。
Comments Accepted by ECCV2026