arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69833 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69833 篇

2606.29814 2026-07-17 cs.CV 版本更新 93%

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Nemotron-Labs-Diffusion-Image:推进掩码离散扩散用于高分辨率图像合成

Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出Nemotron-Labs-Diffusion-Image模型,通过令牌编辑机制和分组交叉熵目标解决掩码离散扩散模型的自校正缺失和训练信号稀疏问题,实现高分辨率文本到图像合成。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08434 2026-06-09 cs.GR cs.CV 版本更新 93%

Bokeh Diffusion: Defocus Blur Control in Text-to-Image Diffusion Models

Bokeh Diffusion:文本到图像扩散模型中的散焦模糊控制

Armando Fortes, Tianyi Wei, Shangchen Zhou, Xingang Pan

机构 * S-Lab, Nanyang Technological University(S实验室,南洋理工大学)

专题命中 扩散模型 :diffusion(title,title_cn);text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出Bokeh Diffusion框架,通过物理散焦模糊参数条件化扩散模型,结合混合训练流程和接地自注意力机制,实现场景一致的散景模糊控制,支持双向模糊强度调整和真实图像编辑。

Comments SIGGRAPH Asia 2025. Project page: https://atfortes.github.io/projects/bokeh-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03752 2026-07-07 cs.CV cs.AI cs.CL cs.MA 新提交 92%

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射

Haruumi Omoto, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03502 2023-10-06 cs.CV 92%

Kandinsky: an Improved Text-to-Image Synthesis with Image Prior and Latent Diffusion

Anton Razzhigaev, Arseniy Shakhmatov, Anastasia Maltseva, Vladimir Arkhipkin, Igor Pavlov, Ilya Ryabov, Angelina Kuts, Alexander Panchenko, Andrey Kuznetsov, Denis Dimitrov

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image synthesis(title);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15388 2023-03-28 cs.CV cs.AI cs.LG 92%

Shifted Diffusion for Text-to-image Generation

Yufan Zhou, Bingchen Liu, Yizhe Zhu, Xiao Yang, Changyou Chen, Jinhui Xu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2023. Code at https://github.com/drboog/Shifted_Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07053 2026-06-08 cs.CV cs.LG 新提交 92%

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器

Dian Gu, Zhengyi Yang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。

Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09094 2025-10-13 cs.CV 92%

Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation

Youwei Zheng, Yuxi Ren, Xin Xia, Xuefeng Xiao, Xiaohua Xie

机构 * Sun Yat-sen University(中山大学) ByteDance Intelligent Creation(字节跳动智能创作) ByteDance Seed Vision(字节跳动种子视觉) Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22792 2025-08-12 cs.CV 92%

Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization

Yuxi Zhang, Yueting Li, Xinyu Du, Sibo Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20449 2025-06-26 cs.CV 92%

Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation

Changlu Guo, Anders Nymark Christensen, Morten Rieger Hannemose

机构 * Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments The project is available at \url{https://medart-ai.github.io}

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03490 2025-01-08 cs.CV 92%

SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation

Shang Chai, Zihang Lin, Min Zhou, Xubin Li, Liansheng Zhuang, Houqiang Li

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12391 2024-12-18 cs.CV cs.CL cs.LG 92%

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation

Hao Li, Shamit Lal, Zhiheng Li, Yusheng Xie, Ying Wang, Yang Zou, Orchid Majumder, R. Manmatha, Zhuowen Tu, Stefano Ermon, Stefano Soatto, Ashwin Swaminathan

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11410 2024-05-21 cs.CV 92%

Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning

Jian Ma, Junhao Liang, Chen Chen, Haonan Lu

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(title);personalized generation(abstract)

Comments Accepted by SIGGRAPH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06380 2024-03-26 cs.LG cs.CV 92%

InstaFlow: One Step is Enough for High-Quality Diffusion-Based Text-to-Image Generation

Xingchao Liu, Xiwen Zhang, Jianzhu Ma, Jian Peng, Qiang Liu

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04692 2024-03-19 cs.CV 92%

PixArt-Σ: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation

Junsong Chen, Chongjian Ge, Enze Xie, Yue Wu, Lewei Yao, Xiaozhe Ren, Zhongdao Wang, Ping Luo, Huchuan Lu, Zhenguo Li

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://pixart-alpha.github.io/PixArt-sigma-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14688 2024-06-19 cs.CL 91%

Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support

Xiaojun Wu, Dixiang Zhang, Ruyi Gan, Junyu Lu, Ziwei Wu, Renliang Sun, Jiaxing Zhang, Pingjian Zhang, Yan Song

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);text-to-image(title,abstract)

Comments Taiyi-Diffusion-XL Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00413 2026-02-03 stat.ML cs.LG 91%

Alignment of Diffusion Model and Flow Matching for Text-to-Image Generation

扩散模型与流匹配的对齐方法用于文本到图像生成

Yidong Ouyang, Liyan Xie, Hongyuan Zha, Guang Cheng

机构 * Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计学系) Department of Industrial and Systems Engineering, University of Minneasota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本文提出了一种无需微调的对齐框架,通过分数指导和速度指导分别优化扩散模型和流匹配模型,显著降低计算成本并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07079 2026-06-08 cs.CV 新提交 91%

AsyncPatch Diffusion: spatially-flexible image generation

异步补丁扩散:空间灵活的图像生成

Samuele Papa, Valentin De Bortoli, Guillaume Couairon, Daniel Sýkora, Romuald Elie, Klaus Greff

机构 * Google DeepMind(谷歌DeepMind) University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(title);inpainting(abstract);分类 cs.CV

AI总结 提出AsyncPatch Diffusion框架,通过为不同空间区域分配不同噪声水平实现异质去噪轨迹,在保持生成质量的同时原生支持图像修复和自适应生成。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01113 2026-05-05 cs.CV 91%

Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation

纪律性扩散:对抗生成不适宜内容的文本到图像扩散模型

Chi Zhang, Changjia Zhu, Xiaowen Li, Yao Liu, Zhuo Lu

机构 * Bellini College of Artificial Intelligence, Cybersecurity(人工智能与网络安全学院) Department of Electrical and Computer Engineering, College of Engineering(电气与计算机工程系) University of South Florida(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,summary_cn);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出Disciplined Diffusion,通过语义检索和局部编辑技术,有效识别并抑制生成图像中的恶意内容,提升文本到图像扩散模型的安全性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13214 2025-09-19 cs.CV 91%

End4: End-to-end Denoising Diffusion for Diffusion-Based Inpainting Detection

Fei Wang, Xuecheng Wu, Zheng Zhang, Danlei Huang, Yuheng Huang, Bo Wang

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12652 2025-04-24 cs.CV 91%

UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing

Tsu-Jui Fu, Yusu Qian, Chen Chen, Wenze Hu, Zhe Gan, Yinfei Yang

机构 * Apple(苹果公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00878 2024-05-03 cs.CV 91%

SonicDiffusion: Audio-Driven Image Generation and Editing with Pretrained Diffusion Models

Burak Can Biner, Farrin Marouf Sofian, Umur Berkay Karakaş, Duygu Ceylan, Erkut Erdem, Aykut Erdem

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03431 2024-03-07 cs.CV 91%

Towards Understanding Cross and Self-Attention in Stable Diffusion for Text-Guided Image Editing

Bingyan Liu, Chengyu Wang, Tingfeng Cao, Kui Jia, Jun Huang

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09869 2023-11-07 cs.CV cs.AI cs.CL cs.LG 91%

Energy-Based Cross Attention for Bayesian Context Update in Text-to-Image Diffusion Models

Geon Yeong Park, Jeongsol Kim, Beomsu Kim, Sang Wan Lee, Jong Chul Ye

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image editing(abstract)

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07596 2023-06-14 cs.CV cs.AI 91%

Paste, Inpaint and Harmonize via Denoising: Subject-Driven Image Editing with Pre-Trained Diffusion Model

Xin Zhang, Jiaxian Guo, Paul Yoo, Yutaka Matsuo, Yusuke Iwasawa

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);inpainting(abstract)

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22216 2026-08-06 eess.IV cs.AI cs.CV 版本更新 91%

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge

Delta-Diffusion: 通过条件泊松扩散桥建模纵向脑淀粉样蛋白-PET轨迹

Yongheng Sun, Minhui Yu, Mengqi Wu, Maureen Kohi, Mingxia Liu

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn);image synthesis(abstract);分类 cs.CV

AI总结 提出Delta-Diffusion框架,将纵向PET合成建模为条件泊松扩散桥过程,结合扩散Transformer和物理启发的泊松扰动,在542名受试者上优于现有方法,准确捕捉淀粉样蛋白沉积的纵向变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26491 2026-05-27 cs.LG cs.CV 91%

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

超越成对偏好:扩散模型的列表级奖励感知对齐

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

机构 * Caltech(加州理工学院) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04504 2026-02-27 cs.CV 91%

Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation

异步去噪扩散模型用于文本到图像生成对齐

Zijing Hu, Yunze Tong, Fengda Zhang, Junkun Yuan, Jun Xiao, Kun Kuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出异步扩散模型,通过为不同像素分配不同时间步以改进文本到图像生成的对齐效果。

Comments Accepted to ICLR 2026, 25 pages, 13 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11487 2025-05-05 cs.CV 91%

Visual Concept-driven Image Generation with Text-to-Image Diffusion Model

Tanzila Rahman, Shweta Mahajan, Hsin-Ying Lee, Jian Ren, Sergey Tulyakov, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Snap Inc.(Snap公司) Vector Institute for AI(向量人工智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title);分类 cs.CV

Comments 11 Figures, 14 Pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03382 2024-10-10 cs.CV 91%

Guided Image Synthesis via Initial Image Editing in Diffusion Model

Jiafeng Mao, Xueting Wang, Kiyoharu Aizawa

专题命中 扩散模型 :diffusion(title,abstract);image editing(title);image synthesis(title);image generation(abstract)

Comments ACM MM 23

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12583 2023-10-20 cs.CV 91%

Diverse Diffusion: Enhancing Image Diversity in Text-to-Image Generation

Mariia Zameshina, Olivier Teytaud, Laurent Najman

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏