Multimodal Large Language Models for Multi-Subject In-Context Image Generation
多模态大语言模型用于多主体上下文图像生成
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)
专题命中 多模态生成 :multimodal(title);MLLM(abstract)
AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。
Comments ACL 2026