RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Model
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)
专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract);diffusion(abstract)
Comments Published as a conference paper at ICCV 2023
专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)
Comments AAAI 2023
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image synthesis(abstract)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);inpainting(abstract)
Comments To appear in the 2024 CHI Conference on Human Factors in Computing Systems (CHI '24), May 11--16, 2024, Honolulu, HI, USA
专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract);diffusion(abstract)
Comments emnlp 2023
机构 * Beijing Normal University(北京师范大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Manchester(曼彻斯特大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学)
专题命中 文生图 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV
Comments Updated author formatting; no substantive changes
LGTM: 通过初始噪声操控实现无训练的光引导文本到图像扩散模型
机构 * RPTU Kaiserslautern-Landau & DFKI GmbH(莱茵-穆尔大学与DFKI GmbH) ; Faculty of Science and Engineering, Hosei University(早稻田大学理工学院)
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR
AI总结 本文提出LGTM模型,通过操控扩散过程的初始噪声实现文本提示和用户指定光照方向的图像生成,无需微调或修改预训练模型,提升了光照控制的灵活性和适应性。
Comments Accepted to IJCNN2026
专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);diffusion(abstract);inpainting(abstract)
Comments Accepted for EMNLP 2024 (Demo track)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments Accepted by ICCV2023. Code and data are available at https://github.com/naver-ai/DenseDiffusion
专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image synthesis(abstract)
专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
Comments CVPR 2023. Project webpage at https://mingukkang.github.io/GigaGAN/
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
机构 * CUHK MMLab(香港中文大学多模态实验室) ; KAUST(科威特科学与技术研究中心) ; Hugging Face(Hugging Face公司) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 文生图 :diffusion(title,abstract);text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV
Comments All code, checkpoints, and datasets are available at \url{https://diffusion-cot.github.io/reflection2perfection}
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);inpainting(abstract);分类 cs.CV
Comments Code is available at https://github.com/NJU-PCALab/RAG-Diffusion
专题命中 文生图 :diffusion(title,abstract);text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV
Comments Code, models and demos can be found through: https://github.com/SHI-Labs/Prompt-Free-Diffusion
机构 * AiHUB Inc.(AiHUB公司) ; Department of Physics, Okayama University of Science(Okayama大学科学部)
专题命中 文生图 :text-to-image(title);diffusion(title);image synthesis(title);image generation(abstract)
Comments 11 pages, 10 figures
SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型
机构 * SeFi Team(SeFi 团队)
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。
通过聚类截断提高自回归文本到图像生成中的样本多样性
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Thoughtworks(Thoughtworks公司)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。
UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。
Comments Project Page: https://w2genai-lab.github.io/UltraFlux/
ELDiff: 当证据学习遇上文本到图像扩散
机构 * Shandong University(山东大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 提出ELDiff模型,利用证据学习中的不确定性度量和冲突检测,增强多目标文本到图像扩散中对象级语义一致性,解决分割图偏差和语义重叠冲突。
BLM-SGAN: 用于语义-空间文本到图像生成的双向语言建模
机构 * Faculty of Computer Science, MSA University, Egypt(MSA大学计算机科学学院,埃及)
专题命中 文生图 :text-to-image(title,abstract);image generation(title,abstract);分类 cs.CV
AI总结 提出BLM-SGAN模型,利用BERT的双向注意力机制捕获长程依赖,解决GAN在文本到图像生成中的梯度消失和序列处理限制,在鸟类图像生成上达到SOTA。
Comments Published in ICACIn 2024. Appears in Advances on Intelligent Computing and Data Science II, Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, 2025
Journal ref Advances on Intelligent Computing and Data Science II (ICACIn 2024), Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, Cham, 2025
通过推理时提示-噪声优化保障文本到图像生成
机构 * University of Minnesota(明尼苏达大学) ; Cisco Research(思科研究) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 提出一种无需训练的推理时优化方法(PNO),通过联合优化连续提示嵌入和注入噪声轨迹,抑制不安全图像生成,达到最先进性能并抵抗对抗攻击。
擦除或侵蚀?评估未学习文本到图像扩散模型中的组合退化
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV
AI总结 本文通过组合文本到图像生成视角,评估未学习方法对 nudity 的影响,发现去除非目标概念与组合完整性之间存在权衡,现有评估方法存在局限。
Comments Accepted at CVPR 2026 Workshop on Machine Unlearning for Computer Vision
模块化能量引导用于基础模型的安全文本到图像生成
机构 * University of California Riverside(加州大学河滨分校) ; University of Maryland(马里兰大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。
SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。
CTCal: 通过跨时间步自校准重新思考文本到图像扩散模型
机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) ; School of Computer Science and Engineering(计算机科学与工程学院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出CTCal,通过利用早期时间步的准确文本-图像对齐来校准后期时间步的表示学习,提升文本到图像生成的对齐精度。
Comments Accepted by CVPR 2026
面向文本到图像生成的代理修复器
专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);inpainting(abstract)
AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。
Comments Accepted by CVPR2026
DivCon:用于文本到图像生成中复杂数值和空间推理的分而治之
机构 * Individual Researcher(独立研究者)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 DivCon通过分而治之的方法提升文本到图像生成中复杂数值和空间推理的能力,通过分解任务提高布局生成和图像合成的精度与质量。
Comments Accepted to ECAI 2025
Journal ref Frontiers in Artificial Intelligence and Applications 413 ECAI 2025 pp 4081-4088
OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成
机构 * Korea University(韩国大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。
Comments 11 pages, 6 figures