arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69868 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69868 篇

2408.00544 2024-08-02 cs.AI 88%

Illustrating Classic Brazilian Books using a Text-To-Image Diffusion Model

Felipe Mahlow, André Felipe Zanella, William Alberto Cruz Castañeda, Regilene Aparecida Sarzi-Ribeiro

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01499 2024-07-02 cs.SD cs.LG eess.AS 88%

Pictures Of MIDI: Controlled Music Generation via Graphical Prompts for Image-Based Diffusion Inpainting

Scott H. Hawley

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Comments 6 pages text + 2 pages references, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06744 2024-01-15 eess.IV cs.NA math.NA 88%

Efficient Parallel Algorithms for Inpainting-Based Representations of 4K Images -- Part I: Homogeneous Diffusion Inpainting

Niklas Kämper, Vassillen Chizhov, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08761 2023-12-27 eess.IV 88%

Regularised Diffusion-Shock Inpainting

Kristina Schaefer, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09450 2023-05-15 eess.IV 88%

Diffusion-Shock Inpainting

Kristina Schaefer, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Journal ref In L. Calatroni, M. Donatelli, S. Morigi, M. Prato, M. Santacesaria (Eds.): Scale Space and Variational Methods in Computer Vision. Lecture Notes in Computer Science, Vol. 14009. Springer, Cham, 588-600, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13285 2023-03-24 physics.med-ph physics.comp-ph 88%

Fourier Diffusion Models: A Method to Control MTF and NPS in Score-Based Stochastic Image Generation

Matthew Tivnan, Jacopo Teneggi, Tzu-Cheng Lee, Ruoqiao Zhang, Kirsten Boedeker, Liang Cai, Grace J. Gang, Jeremias Sulam, J. Webster Stayman

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14371 2023-03-24 eess.IV 88%

Deep Spatial and Tonal Data Optimisation for Homogeneous Diffusion Inpainting

Pascal Peter, Karl Schrader, Tobias Alt, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01217 2023-02-03 stat.ML cs.AI cs.LG math.ST stat.TH 88%

A Theoretical Justification for Image Inpainting using Denoising Diffusion Probabilistic Models

Litu Rout, Advait Parulekar, Constantine Caramanis, Sanjay Shakkottai

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Comments 30 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09642 2023-01-25 q-bio.QM cs.AI cs.LG 88%

DiffSDS: A language diffusion model for protein backbone inpainting under geometric conditions and constraints

Zhangyang Gao, Cheng Tan, Stan Z. Li

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.03946 2022-02-15 eess.IV 88%

Domain Decomposition Algorithms for Real-time Homogeneous Diffusion Inpainting in 4K

Niklas Kämper, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.12263 2020-04-30 eess.IV 88%

Compressing Flow Fields with Edge-aware Homogeneous Diffusion Inpainting

Ferdinand Jost, Pascal Peter, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14580 2026-07-17 cs.CV cs.LG 新提交 87%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 87%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06590 2026-07-09 cs.CV cs.LG 新提交 87%

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型

Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang, Widya Manurung, Samuel Situmeang, Arlinta Barus, Daniel Oranova Siahaan

机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。

Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 87%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16325 2026-07-02 cs.CV 版本更新 87%

UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

UltraImageGen: 高效超高清图像生成与层级局部注意力

Yuyao Zhang, Yu-Wing Tai

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出UltraImageGen框架,通过层级局部注意力和低分辨率全局引导,将预训练扩散模型扩展到8K以上分辨率,实现近线性复杂度、10倍加速和更低内存占用。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 87%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22050 2026-06-01 cs.CV 87%

Broken Memories: Detecting and Mitigating Memorization in Diffusion Models with Degraded Generations

破碎的记忆:通过退化生成检测和缓解扩散模型中的记忆化

Yuanmin Huang, Mi Zhang, Chen Chen, Feifei Li, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(东华大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文首次发现扩散模型中的记忆化会导致内部数值不稳定性并表现为视觉“破碎”伪影,基于此提出了一种基于潜变量更新范数的经验稳定区域来量化稳定行为,并设计了一个即时的逐步骤检测与自适应缓解框架,在不改变提示或引导的情况下抑制记忆化,在Stable Diffusion 1.4上实现了AUC>0.999的检测性能和0.0%的记忆化率。

Comments KDD 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30230 2026-05-29 cs.CV 87%

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

IP-Adapter 就够了:迈向免微调扩散模型的人脸说话视频生成

Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang

机构 * Information Engineering University(信息工程大学) Huai’an University(淮安大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出一种免微调范式,利用预训练的 Stable Diffusion 和 IP-Adapter,结合三个无参数组件解决身份漂移、同步误差和时间不稳定问题,在唇同步精度和视觉保真度上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 87%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 87%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11494 2026-05-13 cs.CV 87%

STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models

STRIDE:通过PCA引导的特征扰动在单步扩散模型中实现训练自由的多样性指导

Ankit Yadav, Arpit Garg, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract,abstract_cn);分类 cs.CV

AI总结 针对单步扩散模型多样性不足问题,STRIDE通过PCA引导的特征扰动在单次前向传递中提升多样性,保持文本对齐性,优于现有训练自由基线。

Comments 11 Pages 3 figures 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV 87%

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08218 2026-05-12 cs.LG cs.CV 87%

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

深度梦境由此构成:在扩散模型中可视化单义特征

Adam Szokalski, Mateusz Modrzejewski

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出通过优化的潜在可视化(LVO)技术,扩展了用于卷积神经网络的特征可视化方法至潜在扩散模型。通过稀疏自编码器(SAEs)将多义层表示分解为单义特征,展示了在Stable Diffusion 1.5模型上可视化可识别概念的效果,相比基线方法更清晰且具有相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14186 2026-05-11 cs.CV 87%

Setting-Matched and Semantics-Scaled Benchmarking of One-Step Generative Models Against Multistep Diffusion and Flow Models

一步生成模型与多步扩散和流模型的匹配与语义缩放基准测试

Advaith Ravishankar, Serena Liu, Mingyang Wang, Todd Zhou, Jeffrey Zhou, Arnav Sharma, Ziling Hu, Léopold Das, Abdulaziz Sobirov, Faizaan Siddique, Freddy Yu, Seungjoo Baek, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过ImageNet验证集、ImageNetV2和reLAIONet数据集,评估了八种模型在类条件协议下的性能,发现FID和CFG选择在少步情况下可能误导,引入csFID、psFID等指标以诊断语义对齐的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02493 2026-05-08 cs.CV cs.AI 87%

PixelGen: Improving Pixel Diffusion with Perceptual Supervision

PixelGen: 通过感知监督改进像素扩散

Zehong Ma, Ruihan Xu, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 PixelGen通过引入LPIPS和P-DINO损失增强x预测,采用噪声门控策略提升图像质量,在ImageNet-256上取得5.11的FID分数,且在文本到图像生成中表现优异。

Comments Project Pages: https://zehong-ma.github.io/PixelGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV 87%

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏