arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2306.14891 2023-07-04 cs.CV cs.LG eess.IV 86%

Fuzzy-Conditioned Diffusion and Diffusion Projection Attention Applied to Facial Image Correction

Majed El Helou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Comments Code available on https://github.com/majedelhelou/FC-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04304 2023-06-09 cs.CV cs.LG 86%

Q-Diffusion: Quantizing Diffusion Models

Xiuyu Li, Yijiang Liu, Long Lian, Huanrui Yang, Zhen Dong, Daniel Kang, Shanghang Zhang, Kurt Keutzer

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments The code is available at https://github.com/Xiuyu-Li/q-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20424 2026-05-26 cs.CR 86%

Attacks on Approximate Caches in Text-to-Image Diffusion Models

文本到图像扩散模型中的近似缓存攻击

Desen Sun, Shuncheng Jie, Sihang Liu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文针对文本到图像扩散模型中的近似缓存优化,提出了远程隐蔽信道、提示词窃取和投毒三种攻击方法,揭示了其严重的安全漏洞。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00126 2026-05-04 cs.LG eess.SP stat.ML 86%

SPLICE: Latent Diffusion over JEPA Embeddings for Conformal Time-Series Inpainting

SPLICE:基于JEPA嵌入的潜在扩散模型用于置信时间序列修复

Arnaud Zinflou

机构 * Hydro-Québec Research Institute Canada(加拿大水电研究院)

专题命中 扩散模型 :inpainting(title,abstract);diffusion(title)

AI总结 SPLICE结合潜在生成修复与分布无关的在线自适应预测区间,通过JEPA编码器、条件潜在桥接和解码器实现时间序列修复,利用ACI保证预测覆盖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07786 2026-03-16 gr-qc astro-ph.HE astro-ph.IM 86%

Accelerating Black Hole Image Generation via Latent Space Diffusion Models

通过潜在空间扩散模型加速黑洞图像生成

Ao Liu, Xudong Zhang, Lin Ding, Cuihong Wen, Wentao Liu, Jieci Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出一种基于潜在空间的扩散模型,通过物理条件生成高保真黑洞图像,显著提升生成效率和图像质量,减少计算成本四倍以上。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01639 2026-03-06 cs.RO 86%

Vision-based Tactile Image Generation via Contact Condition-guided Diffusion Model

基于视觉的触觉图像生成 via 接触条件引导的扩散模型

Xi Lin, Weiliang Xu, Yixian Mao, Jing Wang, Meixuan Lv, Lu Liu, Xihui Luo, Xinming Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出了一种接触条件引导的扩散模型,通过将物体RGB图像和接触力数据映射到高保真的触觉图像,有效降低了均方误差和标记位移误差,提升了触觉视觉传感器在复杂负载下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00992 2026-03-03 cs.LG 86%

Compensation-free Machine Unlearning in Text-to-Image Diffusion Models by Eliminating the Mutual Information

通过消除互信息实现无补偿的文本到图像扩散模型机器反学习

Xinwen Cheng, Jingyuan Zhang, Zhehao Huang, Yingwen Wu, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition(图像处理与模式识别研究所) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文提出无补偿的概念擦除方法MiM-MU,通过最小化互信息精准消除不需要的知识,从而在保持其他生成质量的同时无需事后补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 86%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01294 2026-01-29 cs.SD cs.AI eess.AS 86%

Diffusion Timbre Transfer Via Mutual Information Guided Inpainting

通过互信息引导的修复生成进行扩散音色转移

Ching Ho Lee, Javier Nistal, Stefan Lattner, Marco Pasini, George Fazekas

机构 * Queen Mary University of London(伦敦玛丽女王大学) Sony Computer Science Laboratories(索尼计算机科学实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title)

AI总结 本文提出通过互信息引导的修复生成方法,在无需额外训练的情况下实现音乐音频的音色转移,通过潜在空间噪声注入和早期步骤钳制机制,有效控制音色变化与结构保持的平衡。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10655 2025-12-12 cs.AI 86%

CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models

CAPTAIN: 语义特征注入用于文本到图像扩散模型中的记忆抑制

Tong Zhang, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 CAPTAIN通过在去噪过程中直接修改潜在特征,有效减少文本到图像扩散模型的记忆问题,同时保持提示的保真度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14163 2025-09-18 quant-ph cs.LG 86%

Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures

Chi-Sheng Chen, En-Jui Kuo

机构 * Independent Researcher Cambridge, USA(独立研究者 美国剑桥) Department of Electrophysics National Yang Ming Chiao Tung University Hsinchu, Taiwan(电子物理系 国立阳明交通大学 台北县)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09385 2025-08-14 cs.LG cs.AI 86%

Understanding Dementia Speech Alignment with Diffusion-Based Image Generation

Mansi, Anastasios Lepipas, Dominika Woszczyk, Yiying Guan, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 扩散模型 :image generation(title);diffusion(title);text-to-image(abstract)

Comments Paper accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04208 2025-08-07 cs.CR 86%

DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models

Saifullah Saifullah, Stefan Agne, Andreas Dengel, Sheraz Ahmed

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

Comments Accepted in ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06482 2025-07-21 cs.LG 86%

FedDifRC: Unlocking the Potential of Text-to-Image Diffusion Models in Heterogeneous Federated Learning

Huan Wang, Haoran Li, Huaming Chen, Jun Yan, Jiahua Shi, Jun Shen

机构 * School of Computing and Information Technology, University of Wollongong, Wollongong, Australia(新南威尔士大学计算机与信息科技学院) School of Electrical and Computer Engineering, The University of Sydney, Sydney, Australia(悉尼大学电子与计算机工程学院) QLD Alliance for Agriculture and Food Innovation, The University of Queensland, Brisbane, Australia(昆士兰大学昆士兰农业与食品创新联盟)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

Comments 11 Pages, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10255 2025-01-30 cond-mat.stat-mech math.PR 86%

Convergence properties of Markov models for image generation with applications to spin-flip dynamics and to diffusion processes

Cecile Monthus

专题命中 扩散模型 :image generation(title,abstract);diffusion(title)

Comments v2= revised version with new sections on illustrative examples (28 pages)

Journal ref J. Stat. Mech. (2025) 013213

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12236 2024-08-23 cs.AI 86%

MedDiT: A Knowledge-Controlled Diffusion Transformer Framework for Dynamic Medical Image Generation in Virtual Simulated Patient

Yanzeng Li, Cheng Zeng, Jinchao Zhang, Jie Zhou, Lei Zou

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02649 2023-11-08 physics.med-ph 86%

CBCT-Based Synthetic CT Image Generation Using Conditional Denoising Diffusion Probabilistic Model

Junbo Peng, Richard L. J. Qiu, Jacob F Wynne, Chih-Wei Chang, Shaoyan Pan, Tonghe Wang, Justin Roper, Tian Liu, Pretesh R. Patel, David S. Yu, Xiaofeng Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11546 2026-08-14 cs.CV 版本更新 85%

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model

透过梵高的眼睛:基于扩散模型的全局风格迁移

Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) University of Science and Technology(科技大学) Korea University(高丽大学) Gachon University(嘉泉大学) Kyung Hee University(庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究针对现有艺术图像合成方法难以捕捉艺术家全局风格的问题,提出多对一的全局风格迁移范式及对应的全局风格引导、内容对齐引导方法,在WikiArt上验证了其在风格保真度等指标上的优势。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交 85%

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14270 2026-08-03 cs.CV 版本更新 85%

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

诊断和纠正多模态扩散Transformer中的概念遗漏

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, South Korea Department of Electrical Computer Engineering, Seoul National University, Seoul, South Korea Department of Computer Science \& Engineering, Korea University, Seoul, South Korea ISRC, Seoul National University, Seoul, South Korea

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过线性探测发现文本嵌入中存在表征目标概念缺失的“遗漏信号”,并提出遗漏信号干预(OSI)方法放大该信号以主动催化缺失概念的生成,在FLUX.1-Dev和SD3.5-Medium上显著缓解了概念遗漏问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03434 2026-08-03 cs.GR cs.DC cs.LG 版本更新 85%

Paris: A Decentralized Trained Open-Weight Diffusion Model

巴黎:一种去中心化训练的开放权重扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * Bagel Labs(Bagel实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 Paris是一种通过去中心化训练实现高质量文本到图像生成的开放权重扩散模型,无需专用GPU集群,使用更少的数据和计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24800 2026-07-30 cs.CV 版本更新 85%

Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration

Calibri: 通过参数高效校准增强扩散变换器

Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev

机构 * MSU(莫斯科国立大学) FusionBrain Lab, AXXX(FusionBrain实验室,AXXX)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过深入分析去噪过程,提出Calibri方法,通过引入单个学习缩放参数提升DiT性能,优化校准以提高生成质量,减少推理步骤并保持高质量输出。

Comments Project page: https://v-gen-ai.github.io/Calibri-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 85%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09067 2026-07-13 cs.CV 新提交 85%

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

探索用于对比表示学习的扩散去噪动力学

Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO Data61(联邦科学与工业研究组织数据61实验室) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何让预训练扩散模型的去噪动力学适应判别表示学习,提出D³CL方法,通过结合对比目标与去噪重建损失,利用LoRA更新保持轻量级,实验证明该方法能使重建与对比目标互补,是高效参数适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08794 2026-07-13 cs.GR cs.AI 新提交 85%

Multi-Conditioned Diffusion Synthesis of Sand Boils for Low-Resource Earthen-Levee Inspection

用于低资源土堤检查的砂沸多条件扩散合成

Padam Jung Thapa, Abdullah Bin Naeem, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Department of Computer Science, Louisiana State University New Orleans(路易斯安那州立大学新奥尔良分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.GR

AI总结 针对土堤砂沸像素级检测因注释稀缺受限的问题,提出基于扩散的合成管道,用多分支ControlNet堆栈等技术生成合成图像,经评估各预设利弊后发布标签可靠预设,为低资源土堤检查提供合成图像,限于图像质量等方面,代码等可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07773 2026-07-13 cs.CV 版本更新 85%

Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?

自我超越:外部特征引导是否对于加速扩散变换器训练是必不可少的?

Lingchen Sun, Rongyuan Wu, Zhengqiang Zhang, Ruibin Li, Yujing Sun, Shuaizheng Liu, Lei Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SelfTranscendence方法,通过内部特征监督实现快速收敛,无需外部特征引导,在图像生成任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 85%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新 85%

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 85%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏