arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70051 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2505.05216 2026-01-30 eess.AS cs.SD 82%

Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture

我们是否需要EMA用于基于扩散的语音增强?迈向一种保持幅度的网络架构

Julius Richter, Danilo de Oliveira, Timo Gerkmann

机构 * University of Hamburg, Germany, Department of Informatics, Signal Processing Group(汉堡大学,德国,信息学院,信号处理组)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文研究了基于扩散的语音增强中是否需要EMA,提出了一种保持幅度的网络架构,并通过实验验证了短或无EMA在语音增强中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18932 2026-01-28 eess.IV cs.IT cs.LG math.IT stat.ML 82%

Advances in Diffusion-Based Generative Compression

扩散生成压缩的进展

Yibo Yang, Stephan Mandt

机构 * Chan Zuckerberg Biohub(查纳·泽克拜尔生物枢纽) University of California Irvine(加州大学尔湾分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文探讨了扩散模型在图像生成压缩中的应用,通过统一回顾和理论分析,提出了一种基于率-失真-感知理论的压缩方法,并指出了未来的研究方向。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23593 2026-01-28 cs.LG 82%

Avoid Catastrophic Forgetting with Rank-1 Fisher from Diffusion Models

通过扩散模型的秩1 Fisher避免灾难性遗忘

Zekun Wang, Anant Gupta, Zihan Dong, Christopher J. MacLellan

机构 * College of Computing(计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出基于扩散模型的秩1 EWC 方法,通过改进 Fisher 估计减少持续学习中的灾难性遗忘,提升图像生成任务的 FID 指标。

Comments 19 pages, 14 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26442 2026-01-27 cs.IT math.IT 82%

Diffusion-Aided Bandwidth-Efficient Semantic Communication with Adaptive Requests

扩散辅助的带宽高效语义通信与自适应请求

Xuesong Wang, Xinyan Xie, Mo Li, Zhaoqian Liu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 本文提出了一种基于反馈的闭环语义通信方案,通过自适应请求减少潜在块的传输,提高带宽效率和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04056 2026-01-08 cs.CL 82%

Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion

弥合离散-连续鸿沟:通过耦合流形离散吸收扩散实现统一多模态生成

Yuanfeng Xu, Yuhao Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 CoM-DAD通过耦合流形离散吸收扩散框架,实现离散与连续数据的统一多模态生成,解决多模态对齐与训练稳定性问题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24927 2026-01-01 stat.ML cs.LG math.ST stat.TH 82%

Are First-Order Diffusion Samplers Really Slower? A Fast Forward-Value Approach

一阶扩散采样器真的更慢吗?一种快速前向值方法

Yuchen Jiao, Na Li, Changxiao Cai, Gen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种无训练的一阶扩散采样器,通过前向值评估优化,提高样本质量并优于高阶采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24847 2026-01-01 cs.LG physics.ao-ph 82%

AODDiff: Probabilistic Reconstruction of Aerosol Optical Depth via Diffusion-based Bayesian Inference

AODDiff:基于扩散的贝叶斯推断的气溶胶光学深度概率重建

Linhao Fan, Hongqiang Fang, Jingyang Dai, Yong Jiang, Qixing Zhang

机构 * State Key Laboratory of Fire Science(火灾科学国家重点实验室) University of Science and Technology of China(中国科学技术大学) Fire Research Division(火灾研究部) National Institute of Standards and Technology(美国国家标准与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 AODDiff通过扩散-贝叶斯推断实现气溶胶光学深度的概率重建,具备高空间光谱保真度和不确定性量化能力。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04654 2025-12-30 eess.IV cs.LG 82%

Image and Video Quality Assessment using Prompt-Guided Latent Diffusion Models for Cross-Dataset Generalization

基于提示引导的潜在扩散模型的图像和视频质量评估用于跨数据集泛化

Shankhanil Mitra, Diptanu De, Shika Rao, Rajiv Soundararajan

机构 * Samsung Research Institute(三星研究机构) Qualcomm(高通) New York University(纽约大学) Indian Institute of Science(印度科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出基于提示引导的潜在扩散模型,通过学习跨注意力图和时间质量调节器,实现图像和视频质量评估的跨数据集泛化。

Comments Accepted to Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21020 2025-12-25 stat.ML cs.LG 82%

Enhancing diffusion models with Gaussianization preprocessing

通过高斯化预处理增强扩散模型

Li Cunzhi, Louis Kang, Hideaki Shimazaki

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院) Neural Circuits and Computations Unit, RIKEN Center for Brain Science(脑科学研究所神经回路与计算单元)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 通过高斯化预处理提升扩散模型的生成质量与效率

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09922 2025-12-23 cs.LG 82%

Prototype-Guided Diffusion: Visual Conditioning without External Memory

原型引导扩散:无需外部记忆的视觉条件生成

Bilal Faye, Hanane Azzag, Mustapha Lebbah

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 原型引导扩散模型通过对比学习生成紧凑视觉原型,实现无需外部记忆的高效图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10767 2025-12-17 cs.LG cs.AI math.OC 82%

Understanding Sampler Stochasticity in Training Diffusion Models for RLHF

理解训练扩散模型用于RLHF中的采样随机性

Jiayuan Sheng, Hanyang Zhao, Haoxian Chen, David D. Yao, Wenpin Tang

机构 * Columbia University, IEOR Department(哥伦比亚大学,工业工程与运营研究系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文研究了在训练扩散模型用于RLHF时随机采样与确定性采样之间的不匹配问题,通过理论分析和实验验证,提出了非空的界限和更尖锐的收敛速率,并展示了高随机性SDE训练对ODE采样质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10433 2025-12-12 cs.AI 82%

Targeted Data Protection for Diffusion Model by Matching Training Trajectory

通过匹配训练轨迹实现扩散模型的定向数据保护

Hojun Lee, Mijin Koo, Yeji Song, Nojun Kwak

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出TAFAP方法,通过控制扩散模型的训练轨迹实现有效的定向数据保护,同时保持图像质量,解决了现有方法可控性差的问题。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03056 2025-12-04 cs.LG cs.AI 82%

Delta Sampling: Data-Free Knowledge Transfer Across Diffusion Models

Delta Sampling: 数据无源的知识迁移跨扩散模型

Zhidong Gao, Zimeng Pan, Yuhang Yao, Chenyue Xie, Wei Wei

机构 * Shanxi University(山西大学) Google Cloud(谷歌云) Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 Delta Sampling通过推理时利用模型预测差异实现跨不同架构基模型的知识迁移,无需原始训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10918 2025-12-02 cs.LG cs.AI 82%

ToMA: Token Merge with Attention for Diffusion Models

ToMA: 通过注意力机制的令牌合并用于扩散模型

Wenbo Lu, Shaoyi Zheng, Yuxuan Xia, Shengjie Wang

机构 * Department of Computer Science, New York University(纽约大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 ToMA通过重新设计令牌合并方法,提升扩散模型的GPU效率,减少生成延迟并优化实际性能。

Comments In proceedings of the 42nd International Conference on Machine Learning (ICML 2025). Code available at https://github.com/wenboluu/ToMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19104 2025-12-01 cs.LG eess.IV stat.ML 82%

Composition and Alignment of Diffusion Models using Constrained Learning

扩散模型的组成与对齐:基于约束学习

Shervin Khalafi, Ignacio Hounie, Dongsheng Ding, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Tennessee, Knoxville(田纳西大学,基洛那分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种基于约束学习的框架,通过统一对齐和组成扩散模型,以提高生成样本的质量和符合用户需求的能力。

Comments 48 pages, 6 figures, 15 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16786 2025-12-01 cs.DC 82%

Staleness-Centric Optimizations for Parallel Diffusion MoE Inference

以 staleness 为中心的并行扩散 MoE 推理优化

Jiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song, Rongwei Lu, Chen Tang, Zhi Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 DICE 提出了一种以 staleness 为中心的优化框架,通过交错并行性、选择性同步和条件通信减少 staleness,实现 1.26 倍速度提升并保持高质量。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00359 2025-12-01 cs.LG eess.IV 82%

Linearly Constrained Diffusion Implicit Models

线性约束扩散隐式模型

Vivek Jayaram, Ira Kemelmacher-Shlizerman, Steven M. Seitz, John Thickstun

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 CDIM通过动态调整投影步骤减少数量,实现快速准确解决噪声线性逆问题,适用于多种图像处理任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21180 2025-11-27 cs.CR cs.AI 82%

CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion

CAHS-攻击:针对稳定扩散模型的CLIP感知启发式搜索攻击方法

Shuhan Xia, Jing Dai, Hui Ouyang, Yadong Shang, Dongxiao Zhao, Peipei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Mobile Ltd, Department of Cyber and Information Security Management(中国移动有限公司,网络安全与信息安全管理部) Aspire Information Technology (Beijing) Company Limited(aspire信息技术(北京)有限公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 CAHS-攻击通过CLIP感知的启发式搜索方法,针对稳定扩散模型的文本编码器漏洞,实现高效对抗性提示生成,提升生成模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19379 2025-11-25 cs.LG 82%

Efficiency vs. Fidelity: A Comparative Analysis of Diffusion Probabilistic Models and Flow Matching on Low-Resource Hardware

效率与保真度:扩散概率模型与流匹配在低资源硬件上的比较分析

Srishti Gupta, Yashasvee Taiwade

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本研究通过比较流匹配与扩散模型在低资源硬件上的性能,发现流匹配在效率和保真度上更优,适合实时生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13750 2025-11-24 cs.LG cs.AI 82%

SCALEX: Scalable Concept and Latent Exploration for Diffusion Models

SCALEX:扩散模型的可扩展概念与潜在空间探索

E. Zhixuan Zeng, Yuhao Chen, Alexander Wong

机构 * University of Waterloo(滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 SCALEX通过自然语言提示实现扩散模型潜在空间的可扩展自动化探索,能够检测性别偏见、评估语义对齐并揭示概念结构。

Comments Accepted to WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26324 2025-11-19 cs.LG cs.AI cs.DS math.ST stat.ML stat.TH 82%

Posterior Sampling by Combining Diffusion Models with Annealed Langevin Dynamics

Zhiyang Xun, Shivam Gupta, Eric Price

机构 * UT Austin(得克萨斯大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08241 2025-11-14 cs.RO 82%

BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion

Qiayuan Liao, Takara E. Truong, Xiaoyu Huang, Yuman Gao, Guy Tevet, Koushil Sreenath, C. Karen Liu

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

Comments Project page: https://beyondmimic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15378 2025-11-12 cs.LG 82%

Sampling 3D Molecular Conformers with Diffusion Transformers

J. Thorben Frank, Winfried Ripken, Gregor Lied, Klaus-Robert Müller, Oliver T. Unke, Stefan Chmiela

机构 * Technical University Berlin(技术大学柏林) BIFOLD Berlin(柏林BIFOLD) Google DeepMind(谷歌DeepMind) MPI for Informatics, Saarbrücken(萨尔布吕肯信息研究所) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12727 2025-11-11 cs.LG cs.AI math.ST stat.ML stat.TH 82%

Diffusion Posterior Sampling is Computationally Intractable

Shivam Gupta, Ajil Jalal, Aditya Parulekar, Eric Price, Zhiyang Xun

机构 * UT Austin(德克萨斯大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02793 2025-11-05 eess.IV 82%

Diffusion Models are Robust Pretrainers

Mika Yagoda, Shady Abu-Hussein, Raja Giryes

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments To be published in IEEE Signal Processing Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02530 2025-11-05 cs.AR 82%

Implementation and Evaluation of Stable Diffusion on a General-Purpose CGLA Accelerator

Takuto Ando, Yu Eto, Yasuhiko Nakashima

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

Comments This paper is accepted at 2025 IEEE 18th International Symposium on Embedded Multicore/Many-core Systems-on-Chip (MCSoC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02318 2025-11-03 cs.LG eess.SP math.ST stat.TH 82%

Absorb and Converge: Provable Convergence Guarantee for Absorbing Discrete Diffusion Models

Yuchen Liang, Renxiang Huang, Lifeng Lai, Ness Shroff, Yingbin Liang

机构 * The Ohio State University(俄亥俄州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14036 2025-10-28 cs.LG cs.AI 82%

Adaptive Inference-Time Scaling via Cyclic Diffusion Search

Gyubin Lee, Truong Nhat Nguyen Bao, Jaesik Yoon, Dongwoo Lee, Minsu Kim, Yoshua Bengio, Sungjin Ahn

机构 * KAIST(韩国科学技术院) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) SAP(SAP公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18122 2025-10-22 cs.LG 82%

HyperDiffusionFields (HyDiF): Diffusion-Guided Hypernetworks for Learning Implicit Molecular Neural Fields

Sudarshan Babu, Phillip Lo, Xiao Zhang, Aadi Srivastava, Ali Davariashtiyani, Jason Perera, Michael Maire, Aly A. Khan

机构 * CZ Biohub Chicago, IL(CZ生物枢纽芝加哥分校) University of Chicago(芝加哥大学) Indian Institute of Technology Madras(印度理工学院马德拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17012 2025-10-21 astro-ph.SR physics.space-ph 82%

HelioFill: Diffusion-Based Model for EUV Reconstruction of the Solar Farside

Firas Ben Ameur, Rayan Dhib, Yahia Battach, Andrea Lani, Matteo Parsani, Omar Knio, Stefaan Poedts

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏