Elucidating The Design Space of Classifier-Guided Diffusion Generation
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)
Comments This survey paper is accepted by IJCAI 2023
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)
Comments 7 pages, 8 figures, ICML 2023 Workshop on Challenges in Deployable Generative AI
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR
Comments 11 pages, 9 figures, Project page: https://unity-research.github.io/Geometry-Image-Diffusion.github.io/
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR
Comments CVPR 2024. Code and additional visualizations available: https://single-mesh-diffusion.github.io/
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR
Comments 44 pages, 28 figures. A briefer version was presented at NeurIPS23 Workshop on Diffusion Models [arXiv:2311.10892]
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR
Comments CVPR 2022. Code is available at: https://omriavrahami.com/blended-diffusion-page/
几何至关重要:用于学习语义对应的3D基础先验
机构 * University of Freiburg(弗赖堡大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)
专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出一种3D感知的后训练框架,利用3D基础模型(SAM3D)估计物体几何和姿态,生成几何感知特征图,结合DINO和Stable Diffusion特征,通过测地距离过滤候选对应,训练轻量适配器改进语义对应。
Comments 9 pages (main paper), 21 pages (total), 4 figures
通过测试时训练线性化视觉Transformer
机构 * Tsinghua University(清华大学)
专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV
AI总结 提出利用测试时训练(TTT)架构与Softmax注意力的结构对齐性,结合键实例归一化和局部性增强模块,实现从预训练Transformer到线性注意力模型的有效权重迁移,在Stable Diffusion 3.5上仅需1小时微调即可达到相近的图像生成质量并加速推理。
Comments ICML 2026
MMCORE:多模态连接与表征对齐的潜在嵌入
机构 * ByteDance Seed(字节跳动种子)
专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)
AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。
MaMe & MaRe:基于矩阵的令牌合并与恢复用于高效的视觉感知与合成
专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出MaMe和MaRe,通过矩阵运算实现免训练的令牌合并与恢复,提升视觉模型效率,实验显示在ViT-B上吞吐量提升2%且精度下降1.0%,在图像合成中减少Stable Diffusion v2.1生成延迟31%。
Comments 20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review
专题命中 扩散模型 :image generation(title);text-to-image(title);分类 cs.CV
专题命中 扩散模型 :image generation(title);diffusion(title);分类 cs.CV
少量通道绘制整体画面:揭示扩散变换器中的大规模激活
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。
Comments Project page: https://aimagelab.github.io/MAs-DiT/
PixGS: 像素空间扩散用于直接三维高斯泼溅生成
机构 * Qualcomm AI Research(高通人工智能研究院)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。
Comments Accepted at ECCV 2026
Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架
机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) ; Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR
AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。
Comments SOICT 2025
上下文空间中的即时排斥以实现扩散变换器的丰富多样性
机构 * Tel Aviv University(特拉维夫大学) ; Snap Research Israel(Snap以色列研究)
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR
AI总结 针对文本到图像扩散模型多样性不足的问题,提出在扩散变换器的上下文空间中通过多模态注意力通道施加即时排斥,在不牺牲视觉保真度和语义一致性的前提下显著提升生成多样性,且计算开销小,适用于现代Turbo和蒸馏模型。
Comments SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/
DiFaReli++: 基于扩散的面部光照重建与一致阴影生成
机构 * School of Information Science and Technology, Vidyasirimedhi Institute of Science and Technology(信息科学与技术学院,维达亚西里米迪科学技术研究所)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种单视图面部光照重建方法,通过条件扩散隐式模型实现无光照地面真值训练,实现真实光照下的阴影一致性。
Comments Published in IEEE TPAMI (vol. 48, no. 5, May 2026). This is an extended version of the ICCV 2023 paper (DiFaReli)
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 5, pp. 5068-5082, May 2026
彩色噪声:无需训练的低频噪声操控用于基于颜色的条件图像生成
机构 * Reichman University(雷曼大学)
专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文研究了扩散模型输入噪声的特性,发现低频成分主导图像全局结构和颜色,高频频成分控制细节。通过低频图像先验操控低频噪声,实现无需训练的条件生成,控制整体结构和颜色,保留高频细节多样性。
Comments SIGGRAPH 2026 Conference Paper. Project Page at: https://nadavc220.github.io/colorful-noise/
边缘保留噪声用于扩散模型
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Advanced Micro Devices(先进微器件)
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种边缘保留的扩散过程,通过混合噪声方案在边缘感知调度器中平滑过渡,提升结构细节捕捉能力,同时保持全局性能,并在图像生成和结构引导任务中取得改进。
DiffHDR:利用视频扩散模型重新暴露LDR视频
机构 * Eyeline Labs(Eyeline 实验室) ; Netflix
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR
AI总结 DiffHDR通过视频扩散模型的潜在空间将LDR视频转换为HDR,恢复过曝和欠曝区域的真实细节,提升动态范围和再曝光效果。
Comments 28 pages, 13 figures
图像生成模型:技术史
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文综述了过去十年图像生成模型的快速发展,涵盖VAEs、GANs、正常化流、自回归和Transformer模型以及扩散方法,分析其技术原理、训练方法及局限性,并讨论视频生成和模型鲁棒性等最新进展。
UniVid:金字塔扩散模型用于高质量视频生成
专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM
AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。
ImageRAG:用于参考引导图像生成的动态图像检索
机构 * Tel-Aviv University(特拉维夫大学) ; Tel Aviv University(特拉维夫大学) ; Reichman University(里奇曼大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 ImageRAG通过动态图像检索提升参考引导图像生成的质量,无需专门训练即可适应不同模型类型。
无需训练的文本引导颜色编辑与多模态扩散变换器
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; International Digital Economy Academy(国际数字经济学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Tsinghua University(清华大学) ; Astribot ; StepFun
专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR
AI总结 ColorCtrl通过多模态扩散变换器实现无需训练的文本引导颜色编辑,精准控制颜色属性并保持一致性,优于现有方法和商业模型。
Comments https://zxyin.github.io/ColorCtrl
语义感知的扩散反色调映射
机构 * University of Warwick(沃里克大学)
专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种基于语义感知扩散的反色调映射方法,通过生成被剪裁区域的丢失细节,提升SDR图像至HDR,优于现有方法。
TAG-WM: 通过扩散反向敏感性实现的抗篡改生成图像水印
机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学) ; School of Computing, National University of Singapore(computing学院,新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.MM
AI总结 TAG-WM通过扩散反向敏感性实现抗篡改生成图像水印,提升篡改鲁棒性和定位能力,保持生成质量与水印容量。
FrameDiffuser: 基于G-Buffer的扩散神经渲染
专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR
AI总结 FrameDiffuser通过基于G-buffer的自回归框架实现时间一致的神经渲染,结合结构引导和时间一致性,提升逼真度和效率。
Comments Project Page: https://framediffuser.jdihlmann.com/