arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2604.19141 2026-04-22 cs.CV 87%

Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

去噪、快速与缓慢:面向图像生成的难度感知自适应采样

Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer

机构 * CompVis LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出Patch Forcing框架,通过自适应采样和空间噪声变化提升图像生成效果,优于传统基线方法,适用于分类条件ImageNet和文本到图像生成。

Comments CVPR 2026, Code: https://github.com/CompVis/patch-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17287 2026-04-21 cs.CV 87%

Spectral Forensics of Diffusion Attention Graphs for Copy-Move Forgery Detection

扩散注意力图的频谱取证用于复制-移动伪造检测

H. M. Shadman Tabib, Tasriad Ahmed Tias, Nafis Tahmid

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出GraphSpecForge框架,通过分析预训练Stable Diffusion U-Net的注意力图频谱结构,检测复制-移动伪造。利用归一化图拉普拉斯矩阵的频谱重分布特性,构建基于Wasserstein距离的异常检测器,无需重新训练,在多个基准数据集上取得良好效果。

Comments Preprint before NeurIPS main track submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12668 2026-04-15 cs.CV 87%

OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner

OFA-Diffusion压缩:以一次训练方式压缩扩散模型

Haoyang Jiang, Zekun Wang, Mingyang Yi, Xiuyu Li, Lanqing Hu, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan

机构 * Renmin University of China(中国人民大学) Alibaba Inc.(阿里巴巴公司) Tencent Inc.(腾讯公司) Independent researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(abstract);分类 cs.CV

AI总结 本文提出OFA压缩框架,通过一次训练生成不同计算量的子网络,降低重复训练开销,实现高效压缩的扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19206 2026-03-20 cs.CV 87%

RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing

RPiAE:一种基于表示的自编码器,同时增强图像生成和编辑

Yue Gong, Hongyu Li, Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Xiaoyu Wu, Manyuan Zhang, Dawei Leng, Yuhui Yin, Lijun Zhang

机构 * Beihang University(北航大学) AI Research(360人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出RPiAE,一种基于表示的自编码器,通过引入表示偏转正则化和变分桥梁,提升图像生成和编辑的性能,实验表明其在文本到图像生成和图像编辑中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00036 2026-02-10 cs.LG cs.CV 87%

A-FloPS: Accelerating Diffusion Models via Adaptive Flow Path Sampler

A-FloPS:通过自适应流路径采样器加速扩散模型

Cheng Jin, Zhenyu Xiao, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 A-FloPS通过自适应流路径采样器提升扩散模型的生成质量和效率,实现低计算成本的高质量生成。

Comments published on AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01609 2026-02-03 cs.CV 87%

Token Pruning for In-Context Generation in Diffusion Transformers

令牌剪枝用于扩散变换器中的上下文生成

Junqing Lin, Xingyu Zheng, Pei Cheng, Bin Fu, Jingwei Sun, Guangzhong Sun

机构 * University of Science and Technology of China, Anhui, China(中国科学技术大学) Beihang University, Beijing, China(北京航空航天大学) Tencent PCG, China(腾讯PCG)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 ToPi通过无训练的令牌剪枝框架提升扩散变换器的上下文生成效率,实现30%以上的推理加速同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08250 2025-12-11 cs.CV cs.AI cs.LG 87%

Aligning Text to Image in Diffusion Models is Easier Than You Think

在扩散模型中将文本对齐到图像比你想象的更容易

Jaa-Yeon Lee, Byunghee Cha, Jeongsol Kim, Jong Chul Ye

机构 * Kim Jaechul Graduate School of AI, KAIST(金佳哲人工智能研究生院,韩国科学技术院) Department of Bio and Brain Engineering, KAIST(生物与脑工程系,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 本文提出SoftREPA方法,通过对比学习提升文本与图像表示的对齐效果,减少计算开销,增强语义一致性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00998 2025-11-18 cs.CV cs.AI 87%

FBSDiff: Plug-and-Play Frequency Band Substitution of Diffusion Features for Highly Controllable Text-Driven Image Translation

Xiang Gao, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted conference paper of ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18804 2025-10-07 cs.CV cs.LG 87%

Fast constrained sampling in pre-trained diffusion models

Alexandros Graikos, Nebojsa Jojic, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01540 2025-10-03 cs.CV 87%

Towards Better Optimization For Listwise Preference in Diffusion Models

Jiamu Bai, Xin Yu, Meilong Xu, Weitao Lu, Xin Pan, Kiwan Maeng, Daniel Kifer, Jian Wang, Yu Wang

机构 * Penn State University(宾夕法尼亚州立大学) TikTok Inc.(TikTok公司) Stony Brook University(石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16726 2025-08-12 cs.CV cs.LG 87%

EDiT: Efficient Diffusion Transformers with Linear Compressed Attention

Philipp Becker, Abhinav Mehrotra, Ruchika Chavhan, Malcolm Chadwick, Luca Morreale, Mehdi Noroozi, Alberto Gil Ramos, Sourav Bhattacharya

机构 * Samsung, AI Center Cambridge(三星人工智能中心剑桥)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06134 2025-08-12 cs.CV 87%

X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation

Jian Ma, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu, Zhenyu Yang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01095 2025-05-20 cs.LG cs.CV 87%

DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models

Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, THBI Lab(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室) Tsinghua-Bosch Joint ML Center, Tsinghua University, Beijing, 100084 China(清华大学-博世联合机器学习中心,清华大学,北京,100084中国) Gaoling School of Artificial Intelligence, Renmin University of China(北京人工智能学院,中国人民大学) Beijing Key Laboratory of Big Data Management and Analysis Methods, Beijing, China(北京大数据管理与分析方法重点实验室,北京,中国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20374 2025-04-08 cs.CV cs.LG 87%

FairDiffusion: Enhancing Equity in Latent Diffusion Models via Fair Bayesian Perturbation

Yan Luo, Muhammad Osama Khan, Congcong Wen, Muhammad Muneeb Afzal, Titus Fidelis Wuermeling, Min Shi, Yu Tian, Yi Fang, Mengyu Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Published in Science Advances (https://www.science.org/doi/full/10.1126/sciadv.ads4593). The data and code are made publicly available at https://github.com/Harvard-Ophthalmology-AI-Lab/FairDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16822 2025-03-28 cs.CV cs.AI cs.LG 87%

Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers

Haoran You, Connelly Barnes, Yuqian Zhou, Yan Kang, Zhenbang Du, Wei Zhou, Lingzhi Zhang, Yotam Nitzan, Xiaoyang Liu, Zhe Lin, Eli Shechtman, Sohrab Amirghodsi, Yingyan Celine Lin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12331 2025-03-21 cs.CV cs.AI 87%

I2AM: Interpreting Image-to-Image Latent Diffusion Models via Bi-Attribution Maps

Junseo Park, Hyeryung Jang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08280 2025-03-12 cs.CV cs.AI 87%

OminiControl2: Efficient Conditioning for Diffusion Transformers

Zhenxiong Tan, Qiaochu Xue, Xingyi Yang, Songhua Liu, Xinchao Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02098 2025-03-05 cs.CV cs.LG 87%

EC-DIT: Scaling Diffusion Transformers with Adaptive Expert-Choice Routing

Haotian Sun, Tao Lei, Bowen Zhang, Yanghao Li, Haoshuo Huang, Ruoming Pang, Bo Dai, Nan Du

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10496 2024-11-19 cs.CV 87%

Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing

Kejie Wang, Xuemeng Song, Meng Liu, Jin Yuan, Weili Guan

专题命中 扩散模型 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09608 2024-10-16 cs.CV 87%

Faster Diffusion: Rethinking the Role of the Encoder for Diffusion Model Inference

Senmao Li, Taihang Hu, Joost van de Weijer, Fahad Shahbaz Khan, Tao Liu, Linxuan Li, Shiqi Yang, Yaxing Wang, Ming-Ming Cheng, Jian Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);personalized generation(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17547 2024-10-11 cs.CV 87%

Diffusion Model Compression for Image-to-Image Translation

Geonung Kim, Beomsu Kim, Eunhyeok Park, Sunghyun Cho

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments ACCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18370 2024-10-04 cs.CV cs.LG 87%

Ship in Sight: Diffusion Models for Ship-Image Super Resolution

Luigi Sigillo, Riccardo Fosco Gramaccioni, Alessandro Nicolosi, Danilo Comminiello

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted at 2024 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00350 2024-08-02 cs.CV cs.AI 87%

A Simple Background Augmentation Method for Object Detection with Diffusion Model

Yuhang Li, Xin Dong, Chen Chen, Weiming Zhuang, Lingjuan Lyu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13188 2024-07-22 cs.CV 87%

Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking

Zhiyuan Ma, Guoli Jia, Biqing Qi, Bowen Zhou

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14291 2024-06-18 cs.CV 87%

Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion Models

Pablo Marcos-Manchón, Roberto Alcover-Couso, Juan C. SanMiguel, Jose M. Martínez

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10835 2024-04-08 cs.CV 87%

Your Student is Better Than Expected: Adaptive Teacher-Student Collaboration for Text-Conditional Diffusion Models

Nikita Starodubcev, Artem Fedorov, Artem Babenko, Dmitry Baranchuk

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

Comments CVPR2024 camera ready v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08247 2024-03-19 cs.CV 87%

Diffusion in Diffusion: Cyclic One-Way Diffusion for Text-Vision-Conditioned Generation

Ruoyu Wang, Yongqi Yang, Zhihao Qian, Ye Zhu, Yu Wu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);personalized generation(abstract)

Comments Accepted by ICLR2024, 21 pages with 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00739 2024-01-02 cs.CV cs.AI 87%

DiffMorph: Text-less Image Morphing with Diffusion Models

Shounak Chatterjee

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04884 2023-12-27 cs.CV 87%

UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion Models

Yiming Zhao, Zhouhui Lian

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17908 2023-12-21 cs.CV 87%

Trade-offs in Fine-tuned Diffusion Models Between Accuracy and Interpretability

Mischa Dombrowski, Hadrien Reynaud, Johanna P. Müller, Matthew Baugh, Bernhard Kainz

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏