arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69833 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69833 篇

2112.10741 2022-03-09 cs.CV cs.GR cs.LG 91%

GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models

Alex Nichol, Prafulla Dhariwal, Aditya Ramesh, Pranav Shyam, Pamela Mishkin, Bob McGrew, Ilya Sutskever, Mark Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image editing(abstract);inpainting(abstract)

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07003 2026-08-10 cs.CV 新提交 90%

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

HRDiT:基于现成扩散Transformer模型的无需训练高分辨率图像生成

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) South China University of Technology(华南理工大学) NVIDIA AI Tech Centre(英伟达AI技术中心)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 本研究针对现成DiT模型适配高分辨率图像合成的空间紊乱、生成时间长两大挑战,提出新方法,经实验验证其有效性,代码公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06875 2026-06-08 cs.CV cs.CR 新提交 90%

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

统一安全上下文图像生成:在多模态扩散变换器中通过限制不安全信息流

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 提出UVR框架,通过分析注意力动态中的不安全信息流,在无需训练的情况下对输出补丁进行注意力调制,实现图像生成和编辑任务的安全控制,达到91%和77%的擦除率。

Comments ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00433 2026-04-17 cs.CV cs.LG eess.IV 90%

Latent Wavelet Diffusion For Ultra-High-Resolution Image Synthesis

潜在小波扩散用于超高清图像合成

Luigi Sigillo, Shengfeng He, Danilo Comminiello

机构 * Sapienza University of Rome(罗马大学) Singapore Management University(新加坡管理大学) EMBL(欧洲分子生物学实验室)

专题命中 扩散模型 :diffusion(title,summary_cn);image synthesis(title,abstract);分类 cs.CV

AI总结 本文提出Latent Wavelet Diffusion,通过频率感知的掩码策略和一致性VAE目标提升超高清图像生成的细节和纹理保真度,且无需额外计算开销。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12575 2026-04-15 cs.CV 90%

StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation

StructDiff:一种结构保持且空间可控的单图像生成扩散模型

Yinxi He, Kang Liao, Chunyu Lin, Tianyi Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学研究院,北京交通大学) Visual Intelligence +X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室,北京) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image editing(abstract);image synthesis(abstract)

AI总结 StructDiff基于单尺度扩散模型提出,通过自适应感受野模块和3D位置编码实现结构保持与空间可控,引入基于大语言模型的新型评估标准,优于现有方法在结构一致性、视觉质量和空间可控性上。

Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18352 2025-12-19 cs.CV 90%

Diffusion-4K: Ultra-High-Resolution Image Synthesis with Latent Diffusion Models

Diffusion-4K: 基于潜在扩散模型的超高清图像合成

Jinjin Zhang, Qiuyu Huang, Junjie Liu, Xiefan Guo, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学) School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 Diffusion-4K通过引入Aesthetic-4K基准和基于小波的微调方法,实现了高质量超高清图像合成。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23623 2025-04-01 cs.CV 90%

Language-Guided Trajectory Traversal in Disentangled Stable Diffusion Latent Space for Factorized Medical Image Generation

Zahra TehraniNasab, Amar Kumar, Tal Arbel

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15686 2025-03-25 cs.CV 90%

Multi-focal Conditioned Latent Diffusion for Person Image Synthesis

Jiaqi Liu, Jichao Zhang, Paolo Rota, Nicu Sebe

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);image editing(abstract)

Comments CVPR 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17525 2025-03-12 cs.CV 90%

Diffusion Model-Based Image Editing: A Survey

Yi Huang, Jiancheng Huang, Yifan Liu, Mingfu Yan, Jiaxi Lv, Jianzhuang Liu, Wei Xiong, He Zhang, Liangliang Cao, Shifeng Chen

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);inpainting(abstract)

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02347 2024-12-19 cs.CV cs.AI cs.LG 90%

Flash Diffusion: Accelerating Any Conditional Diffusion Model for Few Steps Image Generation

Clément Chadebec, Onur Tasar, Eyal Benaroche, Benjamin Aubin

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09256 2024-12-06 cs.CV 90%

LIME: Localized Image Editing via Attention Regularization in Diffusion Models

Enis Simsar, Alessio Tonioni, Yongqin Xian, Thomas Hofmann, Federico Tombari

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);text-to-image(abstract)

Comments WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13430 2024-09-12 cs.CV eess.IV 90%

Medical diffusion on a budget: Textual Inversion for medical image generation

Bram de Wilde, Anindo Saha, Maarten de Rooij, Henkjan Huisman, Geert Litjens

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted for publication at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18078 2024-04-10 cs.CV 90%

Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image Synthesis

Yanzuo Lu, Manlin Zhang, Andy J Ma, Xiaohua Xie, Jian-Huang Lai

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Accepted by CVPR 2024 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01407 2024-02-20 cs.CV cs.AI cs.LG 90%

CoDi: Conditional Diffusion Distillation for Higher-Fidelity and Faster Image Generation

Kangfu Mei, Mauricio Delbracio, Hossein Talebi, Zhengzhong Tu, Vishal M. Patel, Peyman Milanfar

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01097 2023-12-27 cs.CV 90%

MVDiffusion: Enabling Holistic Multi-view Image Generation with Correspondence-Aware Diffusion

Shitao Tang, Fuyang Zhang, Jiacheng Chen, Peng Wang, Yasutaka Furukawa

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)

Comments Project page, https://mvdiffusion.github.io; NeurIPS 2023 (spotlight); Compressed camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07222 2023-10-12 cs.CV 90%

Uni-paint: A Unified Framework for Multimodal Image Inpainting with Pretrained Diffusion Model

Shiyuan Yang, Xiaodong Chen, Jing Liao

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Accepted by ACMMM'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05034 2023-03-07 cs.CV 90%

SmartBrush: Text and Shape Guided Object Inpainting with Diffusion Model

Shaoan Xie, Zhifei Zhang, Zhe Lin, Tobias Hinz, Kun Zhang

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);text-to-image(abstract)

Journal ref CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.08827 2021-08-20 cs.CV 90%

ImageBART: Bidirectional Context with Multinomial Diffusion for Autoregressive Image Synthesis

Patrick Esser, Robin Rombach, Andreas Blattmann, Björn Ommer

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30049 2026-05-29 cs.AI 90%

Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers

面向文本到图像扩散Transformer的鲁棒且可泛化的安全引导

Zihao Xue, Yan Wang, Zhen Bi, Long Ma, Zhonglong Zheng, Zeyu Yang, Bingyu Zhu, Longtao Huang, Jie Xiao, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Zhejiang Normal University(浙江师范大学) Zhejiang University of Technology(浙江工业大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);image generation(abstract)

AI总结 提出SafeDIG框架,通过位置感知稀疏特征迁移实现扩散Transformer的安全引导,在保持源域安全性和图像质量的同时,有效降低目标域和整体不安全生成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07865 2026-06-23 cs.CV 版本更新 90%

SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion Models

SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法

Feifei Wang, Zhentao Tan, Tianyi Wei, Yue Wu, Qidong Huang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Cloud(阿里云)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image synthesis(title);分类 cs.CV

AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。

Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09816 2026-06-09 cs.CV cs.AI math.PR 新提交 90%

PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws

PTL-Diffusion: 具有周期终端定律的流形感知扩散

Danqi Zhuang, Jisui Huang, Xiaoyue Xi, Andrew Kiggins, Xiaojie Wang, Ke Chen, Yue Wu

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Harvard University(哈佛大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 提出PTL-Diffusion,通过将前向噪声过程收敛到周期高斯终端族而非单一分布,显式嵌入相位结构,改善低维流形上的分布匹配,在点云和人脸数据集上降低误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24065 2026-05-26 cs.CV 90%

fMRI-Diffusion: Generating fMRI Time Series Via a Temporal Transformer Diffusion Model for Major Depressive Disorder Diagnosis

fMRI-Diffusion: 用于重度抑郁症诊断的基于时间Transformer扩散模型的fMRI时间序列生成

Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 提出fMRI-Diffusion框架,通过时间Transformer扩散模型合成ROI级fMRI时间序列而非功能连接矩阵,以保留时间信息并提升小样本下MDD诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21981 2026-05-22 cs.CV 90%

RiT: Vanilla Diffusion Transformers Suffice in Representation Space

RiT: vanilla diffusion transformers suffice in representation space

Le Zhang, Ning Mang, Aishwarya Agrawal

机构 * Mila – Québec AI Institute, UdeM(魁北克AI研究院,麦吉尔大学) Utrecht University(乌得勒支大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 该研究探讨了在表示空间中使用vanilla diffusion transformers进行图像生成的有效性,发现通过预训练的表示空间能够更有效地进行流匹配学习,从而在ImageNet数据集上取得了优于DiT-DH-XL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07503 2026-05-11 cs.CV 90%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24351 2026-04-28 cs.LG cs.AI cs.CV cs.SE 90%

Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion

扩散模板:一种统一的插件框架,用于可控扩散

Zhongjie Duan, Hong Zhang, Yingda Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,summary_cn);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出Diffusion Templates框架,通过解耦基础模型推理与可控能力注入,统一了扩散模型的可控能力,支持多种任务和不同backbone的兼容性,提升了模块化和可扩展性。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04671 2026-04-16 cs.RO cs.AI cs.CV 90%

X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations

X-Diffusion:在跨具身人类示范上训练扩散策略

Maximus A. Pace, Prithwish Dan, Chuanruo Ning, Atiksh Bhardwaj, Audrey Du, Edward W. Duan, Wei-Chiu Ma, Kushal Kedia

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 本文提出X-Diffusion框架,通过在噪声人类动作上训练扩散策略,提升机器人任务成功率16%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08106 2025-06-17 cs.LG cs.AI cs.CV stat.ML 90%

PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation

Ziyan Wang, Sizhe Wei, Xiaoming Huo, Hao Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02813 2024-04-10 cs.CV cs.AI 90%

BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models

Fengyuan Shi, Jiaxi Gu, Hang Xu, Songcen Xu, Wei Zhang, Limin Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted by CVPR 2024. Project page: https://bivdiff.github.io; GitHub repository: https://github.com/MCG-NJU/BIVDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10210 2024-02-16 cs.LG cs.AI cs.CL cs.CV stat.ML 90%

Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation

Huizhuo Yuan, Zixiang Chen, Kaixuan Ji, Quanquan Gu

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV

Comments 28 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13126 2023-07-20 cs.CV cs.AI 90%

MagicFusion: Boosting Text-to-Image Generation Performance by Fusing Diffusion Models

Jing Zhao, Heliang Zheng, Chaoyue Wang, Long Lan, Wenjing Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(title);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏