arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86306 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3472 篇

2309.00810 2023-09-06 cs.CV cs.AI 90%

RenAIssance: A Survey into AI Text-to-Image Generation in the Era of Large Model

Fengxiang Bie, Yibo Yang, Zhongzhu Zhou, Adam Ghanem, Minjia Zhang, Zhewei Yao, Xiaoxia Wu, Connor Holmes, Pareesa Golnari, David A. Clifton, Yuxiong He, Dacheng Tao, Shuaiwen Leon Song

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02408 2023-08-10 cs.LG cs.AI cs.CR cs.CV 90%

Rickrolling the Artist: Injecting Backdoors into Text Encoders for Text-to-Image Synthesis

Lukas Struppek, Dominik Hintersdorf, Kristian Kersting

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract);diffusion(abstract)

Comments Published as a conference paper at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13753 2022-12-02 cs.CV cs.AI cs.LG 90%

Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis

Wan-Cyuan Fan, Yen-Chun Chen, Dongdong Chen, Yu Cheng, Lu Yuan, Yu-Chiang Frank Wang

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

Comments AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11487 2022-05-24 cs.CV cs.LG 90%

Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding

Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J Fleet, Mohammad Norouzi

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04014 2024-03-08 cs.HC cs.AI 90%

PromptCharm: Text-to-Image Generation through Multi-modal Prompting and Refinement

Zhijie Wang, Yuheng Huang, Da Song, Lei Ma, Tianyi Zhang

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);inpainting(abstract)

Comments To appear in the 2024 CHI Conference on Human Factors in Computing Systems (CHI '24), May 11--16, 2024, Honolulu, HI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06752 2023-11-14 cs.CL 90%

BeautifulPrompt: Towards Automatic Prompt Engineering for Text-to-Image Synthesis

Tingfeng Cao, Chengyu Wang, Bingyan Liu, Ziheng Wu, Jinhui Zhu, Jun Huang

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract);diffusion(abstract)

Comments emnlp 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16503 2025-10-28 cs.CV 90%

Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis

Boming Miao, Chunxiao Li, Xiaoxiao Wang, Andi Zhang, Rui Sun, Zizhe Wang, Yao Zhu

机构 * Beijing Normal University(北京师范大学) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

Comments Updated author formatting; no substantive changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24086 2026-03-26 cs.CV cs.GR 90%

LGTM: Training-Free Light-Guided Text-to-Image Diffusion Model via Initial Noise Manipulation

LGTM: 通过初始噪声操控实现无训练的光引导文本到图像扩散模型

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Ko Watanabe, Riku Takahashi, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau & DFKI GmbH(莱茵-穆尔大学与DFKI GmbH) Faculty of Science and Engineering, Hosei University(早稻田大学理工学院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出LGTM模型,通过操控扩散过程的初始噪声实现文本提示和用户指定光照方向的图像生成,无需微调或修改预训练模型,提升了光照控制的灵活性和适应性。

Comments Accepted to IJCNN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21061 2024-10-29 cs.CV cs.AI cs.MM 90%

Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework

Vladimir Arkhipkin, Viacheslav Vasilev, Andrei Filatov, Igor Pavlov, Julia Agafonova, Nikolai Gerasimenko, Anna Averchenkova, Evelina Mironova, Anton Bukashkin, Konstantin Kulikov, Andrey Kuznetsov, Denis Dimitrov

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);diffusion(abstract);inpainting(abstract)

Comments Accepted for EMNLP 2024 (Demo track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12964 2023-08-25 cs.CV cs.GR cs.LG 90%

Dense Text-to-Image Generation with Attention Modulation

Yunji Kim, Jiyoung Lee, Jin-Hwa Kim, Jung-Woo Ha, Jun-Yan Zhu

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted by ICCV2023. Code and data are available at https://github.com/naver-ai/DenseDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09522 2023-07-18 cs.CV cs.CL cs.GR cs.LG 90%

P+: Extended Textual Conditioning in Text-to-Image Generation

Andrey Voynov, Qinghao Chu, Daniel Cohen-Or, Kfir Aberman

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05511 2023-06-21 cs.CV cs.GR cs.LG 90%

Scaling up GANs for Text-to-Image Synthesis

Minguk Kang, Jun-Yan Zhu, Richard Zhang, Jaesik Park, Eli Shechtman, Sylvain Paris, Taesung Park

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments CVPR 2023. Project webpage at https://mingukkang.github.io/GigaGAN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07093 2023-04-18 cs.CV cs.AI cs.CL cs.GR cs.LG 90%

GLIGEN: Open-Set Grounded Text-to-Image Generation

Yuheng Li, Haotian Liu, Qingyang Wu, Fangzhou Mu, Jianwei Yang, Jianfeng Gao, Chunyuan Li, Yong Jae Lee

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16080 2025-04-23 cs.CV 90%

From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning

Le Zhuo, Liangbing Zhao, Sayak Paul, Yue Liao, Renrui Zhang, Yi Xin, Peng Gao, Mohamed Elhoseiny, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) KAUST(科威特科学与技术研究中心) Hugging Face(Hugging Face公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV

Comments All code, checkpoints, and datasets are available at \url{https://diffusion-cot.github.io/reflection2perfection}

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06558 2024-11-19 cs.CV 90%

Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement

Zhennan Chen, Yajie Li, Haofan Wang, Zhibo Chen, Zhengkai Jiang, Jun Li, Qian Wang, Jian Yang, Ying Tai

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);inpainting(abstract);分类 cs.CV

Comments Code is available at https://github.com/NJU-PCALab/RAG-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16223 2023-06-02 cs.CV 90%

Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models

Xingqian Xu, Jiayi Guo, Zhangyang Wang, Gao Huang, Irfan Essa, Humphrey Shi

专题命中 文生图 :diffusion(title,abstract);text-to-image(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Code, models and demos can be found through: https://github.com/SHI-Labs/Prompt-Free-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08168 2025-11-12 cs.AI 89%

oboro: Text-to-Image Synthesis on Limited Data using Flow-based Diffusion Transformer with MMH Attention

Ryusuke Mizutani, Kazuaki Matano, Tsugumi Kadowaki, Haruki Tenya, Layris, nuigurumi, Koki Hashimoto, Yu Tanaka

机构 * AiHUB Inc.(AiHUB公司) Department of Physics, Okayama University of Science(Okayama大学科学部)

专题命中 文生图 :text-to-image(title);diffusion(title);image synthesis(title);image generation(abstract)

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22568 2026-07-29 cs.CV 版本更新 89%

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型

Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin

机构 * SeFi Team(SeFi 团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交 89%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 89%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20924 2026-06-23 cs.CV 新提交 89%

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

ELDiff: 当证据学习遇上文本到图像扩散

Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

机构 * Shandong University(山东大学) Case Western Reserve University(凯斯西储大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出ELDiff模型,利用证据学习中的不确定性度量和冲突检测,增强多目标文本到图像扩散中对象级语义一致性,解决分割图偏差和语义重叠冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08847 2026-06-09 cs.CV cs.AI cs.LG 新提交 89%

BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation

BLM-SGAN: 用于语义-空间文本到图像生成的双向语言建模

Ahmed Abdelmoneim Mazrou, Haidy Maher El-Amir, Ali Hamdi

机构 * Faculty of Computer Science, MSA University, Egypt(MSA大学计算机科学学院,埃及)

专题命中 文生图 :text-to-image(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 提出BLM-SGAN模型,利用BERT的双向注意力机制捕获长程依赖,解决GAN在文本到图像生成中的梯度消失和序列处理限制,在鸟类图像生成上达到SOTA。

Comments Published in ICACIn 2024. Appears in Advances on Intelligent Computing and Data Science II, Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, 2025

Journal ref Advances on Intelligent Computing and Data Science II (ICACIn 2024), Lecture Notes on Data Engineering and Communications Technologies, vol. 254, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03876 2026-06-01 cs.CV 89%

Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization

通过推理时提示-噪声优化保障文本到图像生成

Jiangweizhi Peng, Zhiwei Tang, Gaowen Liu, Charles Fleming, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的推理时优化方法(PNO),通过联合优化连续提示嵌入和注入噪声轨迹,抑制不安全图像生成,达到最先进性能并抵抗对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04575 2026-04-07 cs.CV 89%

Erasure or Erosion? Evaluating Compositional Degradation in Unlearned Text-To-Image Diffusion Models

擦除或侵蚀?评估未学习文本到图像扩散模型中的组合退化

Arian Komaei Koma, Seyed Amir Kasaei, Ali Aghayari, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过组合文本到图像生成视角,评估未学习方法对 nudity 的影响,发现去除非目标概念与组合完整性之间存在权衡,现有评估方法存在局限。

Comments Accepted at CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02265 2026-04-03 cs.CV 89%

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模块化能量引导用于基础模型的安全文本到图像生成

Yaoteng Tan, Zikui Cai, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) University of Maryland(马里兰大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 89%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20741 2026-03-24 cs.CV 89%

CTCal: Rethinking Text-to-Image Diffusion Models via Cross-Timestep Self-Calibration

CTCal: 通过跨时间步自校准重新思考文本到图像扩散模型

Xiefan Guo, Xinzhu Ma, Haiyu Zhang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science and Engineering(计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CTCal,通过利用早期时间步的准确文本-图像对齐来校准后期时间步的表示学习,提升文本到图像生成的对齐精度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 89%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);inpainting(abstract)

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06400 2026-03-10 cs.CV 89%

DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation

DivCon:用于文本到图像生成中复杂数值和空间推理的分而治之

Yuhao Jia, Wenhan Tan

机构 * Individual Researcher(独立研究者)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 DivCon通过分而治之的方法提升文本到图像生成中复杂数值和空间推理的能力,通过分解任务提高布局生成和图像合成的精度与质量。

Comments Accepted to ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 ECAI 2025 pp 4081-4088

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 89%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏