arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2310.11311 2023-10-18 cs.LG stat.ML 85%

Elucidating The Design Space of Classifier-Guided Diffusion Generation

Jiajun Ma, Tianyang Hu, Wenjia Wang, Jiacheng Sun

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02591 2023-08-29 cs.LG cs.AI cs.SI 85%

Generative Diffusion Models on Graphs: Methods and Applications

Chengyi Liu, Wenqi Fan, Yunqing Liu, Jiatong Li, Hang Li, Hui Liu, Jiliang Tang, Qing Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

Comments This survey paper is accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01193 2023-07-04 cs.LG cs.AI 85%

Squeezing Large-Scale Diffusion Models for Mobile

Jiwoong Choi, Minkyu Kim, Daehyun Ahn, Taesu Kim, Yulhwa Kim, Dongwon Jo, Hyesung Jeon, Jae-Joon Kim, Hyungjun Kim

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

Comments 7 pages, 8 figures, ICML 2023 Workshop on Challenges in Deployable Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12502 2023-05-23 cs.CR 85%

Watermarking Diffusion Model

Yugeng Liu, Zheng Li, Michael Backes, Yun Shen, Yang Zhang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08942 2023-02-01 cs.LG 85%

Meta-Learning via Classifier(-free) Diffusion Guidance

Elvis Nava, Seijin Kobayashi, Yifei Yin, Robert K. Katzschmann, Benjamin F. Grewe

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03718 2024-09-06 cs.CV cs.GR 84%

Geometry Image Diffusion: Fast and Data-Efficient Text-to-3D with Image-Based Surface Representation

Slava Elizarov, Ciara Rowles, Simon Donné

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments 11 pages, 9 figures, Project page: https://unity-research.github.io/Geometry-Image-Diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09250 2024-05-30 cs.CV cs.GR cs.LG 84%

Single Mesh Diffusion Models with Field Latents for Texture Generation

Thomas W. Mitchel, Carlos Esteves, Ameesh Makadia

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments CVPR 2024. Code and additional visualizations available: https://single-mesh-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02490 2024-03-27 cs.CV cs.AI cs.GR cs.NE 84%

Diffusion Models Generate Images Like Painters: an Analytical Theory of Outline First, Details Later

Binxu Wang, John J. Vastola

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

Comments 44 pages, 28 figures. A briefer version was presented at NeurIPS23 Workshop on Diffusion Models [arXiv:2311.10892]

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14818 2023-03-22 cs.CV cs.GR cs.LG 84%

Blended Diffusion for Text-driven Editing of Natural Images

Omri Avrahami, Dani Lischinski, Ohad Fried

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments CVPR 2022. Code is available at: https://omriavrahami.com/blended-diffusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30093 2026-05-29 cs.CV 84%

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence

几何至关重要:用于学习语义对应的3D基础先验

Artur Jesslen, Olaf Dünkel, Adam Kortylewski

机构 * University of Freiburg(弗赖堡大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种3D感知的后训练框架,利用3D基础模型(SAM3D)估计物体几何和姿态,生成几何感知特征图,结合DINO和Stable Diffusion特征,通过测地距离过滤候选对应,训练轻量适配器改进语义对应。

Comments 9 pages (main paper), 21 pages (total), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02772 2026-05-29 cs.CV 84%

Linearizing Vision Transformer with Test-Time Training

通过测试时训练线性化视觉Transformer

Yining Li, Dongchen Han, Zeyu Liu, Hanyi Wang, Yulin Wang, Gao Huang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出利用测试时训练(TTT)架构与Softmax注意力的结构对齐性,结合键实例归一化和局部性增强模块,实现从预训练Transformer到线性注意力模型的有效权重迁移,在Stable Diffusion 3.5上仅需1小时微调即可达到相近的图像生成质量并加速推理。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 84%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13432 2026-04-16 cs.CV cs.AI 84%

MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis

MaMe & MaRe:基于矩阵的令牌合并与恢复用于高效的视觉感知与合成

Simin Huo, Ning Li

专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出MaMe和MaRe,通过矩阵运算实现免训练的令牌合并与恢复,提升视觉模型效率,实验显示在ViT-B上吞吐量提升2%且精度下降1.0%,在图像合成中减少Stable Diffusion v2.1生成延迟31%。

Comments 20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03850 2025-04-08 cs.CV cs.AI cs.CR cs.LG stat.ML 84%

Detection Limits and Statistical Separability of Tree Ring Watermarks in Rectified Flow-based Text-to-Image Generation Models

Ved Umrajkar, Aakash Kumar Singh

专题命中 扩散模型 :image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05444 2025-02-11 eess.IV cs.CV 84%

Diverse Image Generation with Diffusion Models and Cross Class Label Learning for Polyp Classification

Vanshali Sharma, Debesh Jha, M. K. Bhuyan, Pradip K. Das, Ulas Bagci

专题命中 扩散模型 :image generation(title);diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13974 2026-07-08 cs.CV cs.AI cs.MM 版本更新 84%

Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers

少量通道绘制整体画面:揭示扩散变换器中的大规模激活

Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。

Comments Project page: https://aimagelab.github.io/MAs-DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交 84%

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17432 2026-06-17 cs.GR cs.CV 新提交 84%

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

Duy-Dat Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28762 2026-06-04 cs.CV cs.AI cs.GR cs.LG 84%

On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

上下文空间中的即时排斥以实现扩散变换器的丰富多样性

Omer Dahary, Benaya Koren, Daniel Garibi, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Snap Research Israel(Snap以色列研究)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像扩散模型多样性不足的问题,提出在扩散变换器的上下文空间中通过多模态注意力通道施加即时排斥,在不牺牲视觉保真度和语义一致性的前提下显著提升生成多样性,且计算开销小,适用于现代Turbo和蒸馏模型。

Comments SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09479 2026-05-13 cs.CV cs.GR cs.LG 84%

DiFaReli++: Diffusion Face Relighting with Consistent Cast Shadows

DiFaReli++: 基于扩散的面部光照重建与一致阴影生成

Puntawat Ponglertnapakorn, Nontawat Tritrong, Supasorn Suwajanakorn

机构 * School of Information Science and Technology, Vidyasirimedhi Institute of Science and Technology(信息科学与技术学院,维达亚西里米迪科学技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种单视图面部光照重建方法,通过条件扩散隐式模型实现无光照地面真值训练,实现真实光照下的阴影一致性。

Comments Published in IEEE TPAMI (vol. 48, no. 5, May 2026). This is an extended version of the ICCV 2023 paper (DiFaReli)

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 5, pp. 5068-5082, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00548 2026-05-12 cs.CV cs.GR 84%

Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation

彩色噪声:无需训练的低频噪声操控用于基于颜色的条件图像生成

Nadav Z. Cohen, Ofir Abramovich, Ariel Shamir

机构 * Reichman University(雷曼大学)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了扩散模型输入噪声的特性,发现低频成分主导图像全局结构和颜色,高频频成分控制细节。通过低频图像先验操控低频噪声,实现无需训练的条件生成,控制整体结构和颜色,保留高频细节多样性。

Comments SIGGRAPH 2026 Conference Paper. Project Page at: https://nadavc220.github.io/colorful-noise/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01540 2026-04-17 cs.CV cs.AI cs.GR cs.LG 84%

Edge-preserving noise for diffusion models

边缘保留噪声用于扩散模型

Jente Vandersanden, Sascha Holl, Xingchang Huang, Gurprit Singh

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Advanced Micro Devices(先进微器件)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种边缘保留的扩散过程,通过混合噪声方案在边缘感知调度器中平滑过渡,提升结构细节捕捉能力,同时保持全局性能,并在图像生成和结构引导任务中取得改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06161 2026-04-13 cs.CV cs.AI cs.GR 84%

DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models

DiffHDR:利用视频扩散模型重新暴露LDR视频

Zhengming Yu, Li Ma, Mingming He, Leo Isikdogan, Yuancheng Xu, Dmitriy Smirnov, Pablo Salamanca, Dao Mi, Pablo Delgado, Ning Yu, Julien Philip, Xin Li, Wenping Wang, Paul Debevec

机构 * Eyeline Labs(Eyeline 实验室) Netflix

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 DiffHDR通过视频扩散模型的潜在空间将LDR视频转换为HDR,恢复过曝和欠曝区域的真实细节,提升动态范围和再曝光效果。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07455 2026-03-31 cs.CV cs.AI cs.CL cs.GR 84%

Image Generation Models: A Technical History

图像生成模型:技术史

Rouzbeh Shirvani

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13739 2026-03-17 cs.CV cs.AI cs.MM 84%

UniVid: Pyramid Diffusion Model for High Quality Video Generation

UniVid:金字塔扩散模型用于高质量视频生成

Xinyu Xiao, Binbin Yang, Tingtian Li, Yipeng Yu, Sen Lei

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09411 2026-02-10 cs.CV cs.GR 84%

ImageRAG: Dynamic Image Retrieval for Reference-Guided Image Generation

ImageRAG:用于参考引导图像生成的动态图像检索

Rotem Shalev-Arkushin, Rinon Gal, Amit H. Bermano, Ohad Fried

机构 * Tel-Aviv University(特拉维夫大学) Tel Aviv University(特拉维夫大学) Reichman University(里奇曼大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 ImageRAG通过动态图像检索提升参考引导图像生成的质量,无需专门训练即可适应不同模型类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09131 2026-02-04 cs.GR cs.AI cs.CV 84%

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

无需训练的文本引导颜色编辑与多模态扩散变换器

Zixin Yin, Xili Dai, Ling-Hao Chen, Deyu Zhou, Jianan Wang, Duomin Wang, Gang Yu, Lionel M. Ni, Lei Zhang, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学) Astribot StepFun

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

AI总结 ColorCtrl通过多模态扩散变换器实现无需训练的文本引导颜色编辑,精准控制颜色属性并保持一致性,优于现有方法和商业模型。

Comments https://zxyin.github.io/ColorCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15468 2026-01-13 cs.CV cs.GR 84%

Semantic Aware Diffusion Inverse Tone Mapping

语义感知的扩散反色调映射

Abhishek Goswami, Aru Ranjan Singh, Francesco Banterle, Kurt Debattista, Thomas Bashford-Rogers

机构 * University of Warwick(沃里克大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种基于语义感知扩散的反色调映射方法,通过生成被剪裁区域的丢失细节,提升SDR图像至HDR,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23484 2025-12-23 cs.MM cs.CV eess.IV 84%

TAG-WM: Tamper-Aware Generative Image Watermarking via Diffusion Inversion Sensitivity

TAG-WM: 通过扩散反向敏感性实现的抗篡改生成图像水印

Yuzhuo Chen, Zehua Ma, Han Fang, Weiming Zhang, Nenghai Yu

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学) School of Computing, National University of Singapore(computing学院,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM

AI总结 TAG-WM通过扩散反向敏感性实现抗篡改生成图像水印,提升篡改鲁棒性和定位能力,保持生成质量与水印容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16670 2025-12-19 cs.CV cs.GR 84%

FrameDiffuser: G-Buffer-Conditioned Diffusion for Neural Forward Frame Rendering

FrameDiffuser: 基于G-Buffer的扩散神经渲染

Ole Beisswenger, Jan-Niklas Dihlmann, Hendrik P. A. Lensch

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 FrameDiffuser通过基于G-buffer的自回归框架实现时间一致的神经渲染,结合结构引导和时间一致性,提升逼真度和效率。

Comments Project Page: https://framediffuser.jdihlmann.com/

详情

展开后加载摘要…

URL PDF HTML 收藏