arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2207.13038 2022-07-27 cs.CV 83%

Text-Guided Synthesis of Artistic Images with Retrieval-Augmented Diffusion Models

Robin Rombach, Andreas Blattmann, Björn Ommer

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.00386 2022-06-02 cs.CV cs.AI 83%

DiVAE: Photorealistic Images Synthesis with Denoising Diffusion Decoder

Jie Shi, Chenfei Wu, Jian Liang, Xiang Liu, Nan Duan

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.12524 2022-05-31 cs.CV 83%

Accelerating Diffusion Models via Early Stop of the Diffusion Process

Zhaoyang Lyu, Xudong XU, Ceyuan Yang, Dahua Lin, Bo Dai

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Code is released at https://github.com/ZhaoyangLyu/Early_Stopped_DDPM

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05826 2022-05-05 cs.CV cs.LG 83%

Palette: Image-to-Image Diffusion Models

Chitwan Saharia, William Chan, Huiwen Chang, Chris A. Lee, Jonathan Ho, Tim Salimans, David J. Fleet, Mohammad Norouzi

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02641 2022-04-07 cs.CV 83%

The Swiss Army Knife for Image-to-Image Translation: Multi-Task Diffusion Models

Julia Wolleb, Robin Sandkühler, Florentin Bieder, Philippe C. Cattin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05146 2022-03-22 eess.IV cs.CV cs.LG stat.ML 83%

Come-Closer-Diffuse-Faster: Accelerating Conditional Diffusion Models for Inverse Problems through Stochastic Contraction

Hyungjin Chung, Byeongsu Sim, Jong Chul Ye

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments Accepted to CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.03126 2022-03-17 cs.CV cs.LG 83%

Label-Efficient Semantic Segmentation with Diffusion Models

Dmitry Baranchuk, Ivan Rubachev, Andrey Voynov, Valentin Khrulkov, Artem Babenko

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments ICLR'2022; v3: camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04304 2022-03-16 cs.CV eess.IV 83%

Dynamic Dual-Output Diffusion Models

Yaniv Benny, Lior Wolf

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments To be presented at CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.15640 2022-03-14 cs.CV cs.LG 83%

Diffusion Autoencoders: Toward a Meaningful and Decodable Representation

Konpat Preechakul, Nattanat Chatthee, Suttisak Wizadwongsa, Supasorn Suwajanakorn

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Please visit our project page: https://Diff-AE.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02938 2021-09-16 cs.CV 83%

ILVR: Conditioning Method for Denoising Diffusion Probabilistic Models

Jooyoung Choi, Sungwon Kim, Yonghyun Jeong, Youngjune Gwon, Sungroh Yoon

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments ICCV 2021 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02600 2021-09-14 cs.LG cs.CV 83%

Noise Estimation for Generative Diffusion Models

Robin San-Roman, Eliya Nachmani, Lior Wolf

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.06819 2021-06-15 cs.LG cs.AI cs.CV 83%

D2C: Diffusion-Denoising Models for Few-shot Conditional Generation

Abhishek Sinha, Jiaming Song, Chenlin Meng, Stefano Ermon

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01551 2019-01-04 cs.CV stat.ML 83%

Manifold-valued Image Generation with Wasserstein Generative Adversarial Nets

Zhiwu Huang, Jiqing Wu, Luc Van Gool

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted by AAAI 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.05817 2018-11-28 cs.CV cs.AI cs.NE 83%

ProstateGAN: Mitigating Data Bias via Prostate Diffusion Imaging Synthesis with Generative Adversarial Networks

Xiaodan Hu, Audrey G. Chung, Paul Fieguth, Farzad Khalvati, Masoom A. Haider, Alexander Wong

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06185 2026-02-02 cs.LG cs.NA math.NA stat.CO stat.ML 83%

Antithetic Noise in Diffusion Models

扩散模型中的反向噪声

Jing Jia, Sifan Liu, Bowen Song, Wei Yuan, Liyue Shen, Guanyang Wang

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系) Department of EECS, University of Michigan(密歇根大学电子工程与计算机科学系) Department of Statistics, Rutgers University(罗格斯大学统计系)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 扩散模型中反向噪声产生强负相关,提升不确定性量化可靠性,适用于图像编辑和生成多样性改进。

Comments Code: https://github.com/jjia131/Antithetic-Noise-in-Diffusion-Models-page, Project Page: https://jjia131.github.io/Antithetic-Noise-in-Diffusion-Models-page/, Blog: https://jjia131.github.io/Antithetic-Noise-in-Diffusion-Models-page/static/blog/blog.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23614 2025-10-07 cs.LG stat.ML 83%

Inference-time Scaling of Diffusion Models through Classical Search

Xiangcheng Zhang, Haowei Lin, Haotian Ye, James Zou, Jianzhu Ma, Yitao Liang, Yilun Du

机构 * Helixon US Inc.(Helixon US公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments Website at https://diffusion-inference-scaling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10193 2025-05-29 cs.LG 83%

Simple Guidance Mechanisms for Discrete Diffusion Models

Yair Schiff, Subham Sekhar Sahoo, Hao Phung, Guanghan Wang, Sam Boshar, Hugo Dalla-torre, Bernardo P. de Almeida, Alexander Rush, Thomas Pierrot, Volodymyr Kuleshov

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) InstaDeep

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments ICLR 2025; Code to reproduce our experiments is available here: https://github.com/kuleshov-group/discrete-diffusion-guidance

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04313 2024-05-28 cs.LG cs.AI q-bio.BM q-bio.QM stat.ML 83%

Geometry-Complete Diffusion for 3D Molecule Generation and Optimization

Alex Morehead, Jianlin Cheng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments 33 pages, 6 figures, 5 tables. Under review. Also presented at ICLR 2023's MLDD workshop. Code available at https://github.com/BioinfoMachineLearning/Bio-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04746 2023-04-11 cs.CL cs.AI 83%

A Cheaper and Better Diffusion Language Model with Soft-Masked Noise

Jiaao Chen, Aston Zhang, Mu Li, Alex Smola, Diyi Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments Code is available at https://github.com/amazon-science/masked-diffusion-lm

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09991 2022-12-22 cs.LG cs.AI 83%

Planning with Diffusion for Flexible Behavior Synthesis

Michael Janner, Yilun Du, Joshua B. Tenenbaum, Sergey Levine

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

Comments ICML 2022 (long talk). Project page and code at https://diffusion-planning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20722 2026-06-23 cs.GR cs.CL cs.CV cs.LG 新提交 82%

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

多模态图像着色:量化文本条件引导对灰度到彩色转换的影响

Colten Reissmann, Hugo Garrido-Lestache Belinchon

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV、cs.GR

AI总结 本文通过U-Net和Stable Diffusion 1.5两种架构,量化了CLIP文本条件对灰度图像着色质量的影响,发现文本条件显著提升了PSNR、SSIM和色彩度,降低了LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18324 2026-06-16 cs.CV cs.AI cs.GR cs.LG stat.ML 版本更新 82%

Improved Baselines with Representation Autoencoders

改进的基于表示自动编码器的基线

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了基于表示自动编码器(RAE)的设计选择,发现三个见解,简化并改进了RAE。首先,研究了一种通用公式,将表示定义为最后k个编码器层的总和,而不是仅最终层。其次,研究了RAE与表示对齐(REPA)的假设,发现两者具有互补的工作机制。最后,改进了RAE在无分类器指导(CFG)中的表现,通过重新参数化DiT模型输出,实现了无需训练第二个模型的指导效果。RAEv2在ImageNet-256上达到了1.06的gFID,且训练效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19119 2026-08-20 cs.LG cs.AI 新提交 82%

Discretizing Continuous Time Series for Imputation with Masked Diffusion Training

用于掩码扩散训练插补的连续时间序列离散化

Dongbin Kim, Seungyun Lee, Geonwoo Shin, Jaewook Lee

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对时间序列插补的现有方法存在的局限性,提出MDTIM模型,引入随机离散化技术,在多种基准上的实验显示其鲁棒性和可扩展性优于现有基线方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 82%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16946 2026-08-19 math.PR 新提交 82%

A diffusion model for time-dependent compositional data

用于时变成分数据的扩散模型

Lu Chen, Omar De la Cruz Cabrera, Oana Mocioalca

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出了名为Dirichlet扩散(DD)的随机过程,用于建模时变成分数据的演化,证明了其解的存在性与聚合性,可用于微生物组演化的联合建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15144 2026-08-18 stat.ML cs.AI cs.LG 新提交 82%

Scale-Consistent Posterior Dynamics for Diffusion Inverse Problems

扩散逆问题的尺度一致后验动力学

Zhaoqiang Liu, Tongyao Pang, Ruibing Wang, Yang Zheng

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 该研究针对扩散逆问题,提出尺度一致后验动力学方法,通过设计SDE模型、离散化算法并完成理论证明,在FFHQ和ImageNet的超分辨率等任务中取得竞争力结果。

Comments 29 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15288 2026-08-18 cs.AI 新提交 82%

$D^{2}R^{2}$: Discrete Diffusion with Regulation Reinforcement for Single-Cell Perturbation Prediction

$D^{2}R^{2}$:带调控强化的离散扩散模型用于单细胞扰动预测

Ninghan Fan, Qi Liu, Xunuo Zhu, Yukai Sun, Luyuan Chen, Xuheng Zhou, Yuetian Du, Ming Kong, Xiaojun Zhu, Jie Liu, Zhan Zhou, Qiang Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出$D^{2}R^{2}$模型,将单细胞扰动预测转化为调控引导的基因渐进式生成,在Norman19数据集上实现5项指标最优,验证了基因生成顺序的有效性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23811 2026-08-18 cs.SD cs.CL 版本更新 82%

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

基于解耦时间深度扩散变换器的内存高效音频合成

Dongseong Hwang, Prasanth Yadla, Kaan Elgin, Shifas Padinjaru Veettil, Sivanand Achanta, Dipjyoti Paul, Ramya Rasipuram, Tyler Johnson, Emad Soroush, Chung-Cheng Chiu, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出基于解耦时间深度扩散变换器的内存高效音频合成架构,通过特定设计将语义音频令牌转换为RVQ表示,用单个深度解码器和因果滑动窗口注意力降低内存复杂度,在AMX上实现高效合成,提升音频质量。

Comments 11 pages, ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26632 2026-08-18 cs.LG 版本更新 82%

RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Xing Cong, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chenhao Xie

机构 * Alibaba Group(阿里巴巴集团) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散模型推理成本高的问题,提出将N:M半结构化稀疏性从权重转移到激活,结合误差补偿技术,实现线性层平均1.55倍加速且保持生成质量。

Comments 33 pages, 18 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 82%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏