arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-13 至 2026-05-13 共收录 94 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 94 篇

2605.11494 2026-05-13 cs.CV 87%

STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models

STRIDE:通过PCA引导的特征扰动在单步扩散模型中实现训练自由的多样性指导

Ankit Yadav, Arpit Garg, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract,abstract_cn);分类 cs.CV

AI总结 针对单步扩散模型多样性不足问题,STRIDE通过PCA引导的特征扰动在单次前向传递中提升多样性,保持文本对齐性,优于现有训练自由基线。

Comments 11 Pages 3 figures 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06779 2026-05-13 cs.AI 85%

VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion

VASR:基于奖励引导扩散的方差感知系统性重采样

Shivanshu Shekhar, Sagnik Mukherjee, Jia Yi Zhang, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) Department of Statistics(统计学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出VASR方法,通过分解延续方差与残余方差,解决奖励引导扩散SMC中的快速谱系崩溃问题,提升样本质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09479 2026-05-13 cs.CV cs.GR cs.LG 84%

DiFaReli++: Diffusion Face Relighting with Consistent Cast Shadows

DiFaReli++: 基于扩散的面部光照重建与一致阴影生成

Puntawat Ponglertnapakorn, Nontawat Tritrong, Supasorn Suwajanakorn

机构 * School of Information Science and Technology, Vidyasirimedhi Institute of Science and Technology(信息科学与技术学院,维达亚西里米迪科学技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种单视图面部光照重建方法,通过条件扩散隐式模型实现无光照地面真值训练,实现真实光照下的阴影一致性。

Comments Published in IEEE TPAMI (vol. 48, no. 5, May 2026). This is an extended version of the ICCV 2023 paper (DiFaReli)

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 5, pp. 5068-5082, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12122 2026-05-13 cs.LG cs.AI cs.CV 83%

Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning

解耦稀疏表示用于概念分离的扩散撤销

Hyeonjin Kim, Hangyeol Jung, Heechan Yun, Sungjun Yun, Dong-Jun Han

机构 * Yonsei University(延世大学) Kookmin University(韩国釜山大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SAEParate,通过概念感知对比目标解耦潜在表示,提升扩散模型中特定概念撤销的精度与效果,实验显示在联合风格-物体撤销任务中表现优异。

Comments 40 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11506 2026-05-13 cs.CV 83%

Principled Design of Diffusion-based Optimizers for Inverse Problems

基于逆问题的扩散优化器原理化设计

Julio Oscanoa, Irmak Sivgin, Cagan Alkan, Daniel Ennis, John Pauly, Mert Pilanci, Shreyas Vasanawala

机构 * Department of Bioengineering(生物工程系) Department of Radiology, Stanford University, USA(斯坦福大学放射学系,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出原理化重参数化方法,使扩散模型在逆问题中能复用超参数,提升推理速度和图像质量。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11311 2026-05-13 cs.LG cs.CV stat.CO stat.ML 83%

Couple to Control: Joint Initial Noise Design in Diffusion Models

耦合控制:扩散模型中的联合初始噪声设计

Jing Jia, Liyue Shen, Guanyang Wang

机构 * Department of Computer Science(计算机科学系) Rutgers University(罗格斯大学) Department of EECS(电子工程与计算机科学系) University of Michigan(密歇根大学) Department of Statistics(统计学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过设计多样本展厅的依赖结构来控制初始噪声,改进生成质量并提升多样性,同时支持结构化初始化。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11014 2026-05-13 cs.LG cs.AI 82%

Backbone-Equated Diffusion OOD via Sparse Internal Snapshots

基于稀疏内部快照的扩散模型异常检测

Yadang Alexis Rouzoumka, Jean Pinsolle, Eugénie Terreaux, Christèle Morisseau, Jean-Philippe Ovarlez, Chengfang Ren

机构 * ONERA SONDRA Université Paris-Saclay(巴黎-萨克雷大学) CentraleSupélec(中央理工-巴黎高等学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种互化背骨等效协议,通过冻结扩散背骨使用少量内部激活来构建检测器,证明异常信号集中在稀疏内部状态而非完整去噪轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06412 2026-05-13 cs.CL cs.LG 82%

Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding

在掩码扩散语言模型解码中停止收敛令牌的计算

Daisuke Oba, Danushka Bollegala, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) University of Liverpool(利物浦大学) Amazon(亚马逊) MBZUAI

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SureLock方法,通过锁定稳定位置以减少计算开销,提升解码效率,实验证明在LLaDA-8B上节省30-50%的FLOPs同时保持生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12495 2026-05-13 cs.CV cs.AI cs.LG 81%

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11115 2026-05-13 cs.CV cs.GR cs.LG 81%

LatentHDR: Decoupling Exposure from Diffusion via Conditional Latent-to-Latent Mapping for Text/Image-to-Panoramic HDR

LatentHDR: 通过条件潜变量到潜变量映射解耦曝光以生成文本/图像到全景HDR

Pedram Fekri, WenChen Li, William Chen, Peter Altamirano

机构 * Monks AI Research Lab(Monks AI研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出LatentHDR框架,通过在潜在空间中解耦场景生成与曝光建模,实现高效且结构一致的HDR生成,实验表明其在动态范围和感知质量上优于现有方法,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12431 2026-05-13 cs.CV 79%

GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization

GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识

Huiran Duan, Qian Zhou, Zhongliang Guo, Junhao Dong, Yuqi Li, Guoying Zhao, Yingli Tian

机构 * City University of New York(纽约城市大学) Wuhan University(武汉大学) University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12399 2026-05-13 cs.CV 79%

GeoQuery: Geometry-Query Diffusion for Sparse-View Reconstruction

GeoQuery: 用于稀疏视角重建的几何-查询扩散

Xiao Cao, Yuze Li, Youmin Zhang, Jiayu Song, Cheng Yan, Wen Li, Lixin Duan

机构 * University of Electronic Science Tianjin University Tianjin China Tianjin University

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoQuery,通过几何引导的扩散框架,在稀疏视角重建中有效减少渲染伪影。

Comments Accept to SIGGRAPH 2026 Conference Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12169 2026-05-13 cs.CV 79%

UniFixer: A Universal Reference-Guided Fixer for Diffusion-Based View Synthesis

UniFixer:一种通用参考引导的扩散基视图合成修复器

Sihan Chen, Xiang Zhang, Yang Zhang, Tunc Aydin, Christopher Schroers

机构 * ETH Zürich(苏黎世联邦理工学院) DisneyResearch|Studios(迪士尼研究实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniFixer,通过粗到细策略修复扩散基视图合成中的多种退化问题,包括空间、时间及模型相关的退化,通过参考预对齐、全局结构锚定和局部细节注入模块实现高质量视图合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11898 2026-05-13 cs.CV 79%

Few-Shot Synthetic Data Generation with Diffusion Models for Downstream Vision Tasks

少样本合成数据生成与扩散模型用于下游视觉任务

Daniil Dushenev, Nazariy Karpov, Daniil Zinovjev, Alexander Gorin, Konstantin Kulikov

机构 * National University of Science and Technology MISIS(俄罗斯莫斯科国立研究型技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种轻量级合成数据增强方法,通过微调LoRA适配器和预训练扩散模型生成合成样本,提升罕见类别的召回率和F1分数,适用于不同视觉领域。

Comments 5 pages, 3 figures, 1 table. Accepted at SynData4CV Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10916 2026-05-13 cs.CV cs.AI 79%

Confidence-Guided Diffusion Augmentation for Enhanced Bangla Compound Character Recognition

基于置信度引导的扩散增强法提升孟加拉语复合字符识别

Md. Sultan Al Rayhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种置信度引导的扩散增强框架,通过结合分类引导和改进的U-Net结构,提升低分辨率孟加拉语复合字符识别性能,实验表明在AIBangla数据集上多个模型的分类准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI 79%

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11758 2026-05-13 eess.IV cs.CV 79%

DiffSegLung: Diffusion Radiomic Distillation for Unsupervised Lung Pathology Segmentation

DiffSegLung: 基于扩散的放射组学蒸馏用于无监督肺部病理分割

Rezkellah Noureddine Khiati, Pierre-Yves Brillet, Catalin Fetita

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffSegLung,通过引入扩散放射组学蒸馏方法,利用手工制作的放射组学描述符作为物理基础的教师,引导3D扩散U-Net的瓶颈层,提升无监督肺部病理分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11628 2026-05-13 cs.CV 79%

Single-Shot HDR Recovery via a Video Diffusion Prior

单次曝光HDR恢复通过视频扩散先验

Chinmay Talegaonkar, Jinshi He, Christopher McKenna, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校) Creare LLC(Creare公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11435 2026-05-13 cs.CV 79%

ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models

ZeroIDIR:基于扰动一致扩散模型的零参考照明退化图像恢复

Hai Jiang, Zhen Liu, Yinjie Lei, Songchen Han, Bing Zeng, Shuaicheng Liu

机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) University of Electronic Science and Technology of China(电子科技大学) College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ZeroIDIR框架,通过自适应伽马校正模块和扰动一致性扩散模型,实现零参考照明退化图像恢复,提升恢复精度与稳定性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11424 2026-05-13 cs.CV 79%

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

VidSplat:基于几何引导视频扩散先验的高斯点云重建

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。

Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02043 2026-05-13 cs.CV cs.HC cs.LG 79%

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

基于扩散模型的零样本人体姿态估计

Sahil Bhandary Karnoor, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InPose方法,通过预训练扩散模型和旋转测量条件,解决人体姿态估计中用户体型差异导致的泛化问题。

Comments Published as a Conference Paper at The Fourteenth International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12247 2026-05-13 cs.RO 78%

SI-Diff: A Framework for Learning Search and High-Precision Insertion with a Force-Domain Diffusion Policy

SI-Diff: 一种通过力域扩散策略学习搜索和高精度插入的框架

Yibo Liu, Stanko Oparnica, Simon Shewchun-Jakaitis, Guoyi Fu, Jie Wang, Jun Yang, Anand Jagannathan, Tony Hong-Yau Lo

机构 * Epson Canada(爱普生加拿大) Queen’s University(皇后大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SI-Diff通过力域扩散策略整合搜索与高精度插入,提升装配容忍度与迁移能力。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12231 2026-05-13 math.OC 78%

Geometric Asymptotics of Score Mixing and Guidance in Diffusion Models

分数混合与扩散模型中的几何渐进行为

Kang Liu, Enrique Zuazua

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了扩散模型中分数混合的动力学,通过几何势函数将非自治的分数驱动动力学转化为自治的Clarke型子梯度包含,揭示了混合参数对生成过程的影响。

Comments 63 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12157 2026-05-13 math.DS math.AP math.FA math.OA 78%

On solution of Diffusion Equation using Conformable Laplace Transform

利用可适配分数拉普拉斯变换求解扩散方程

Somnath Sarate, Anil Khairnar, Krishnat Masalkar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文发展了可适配分数拉普拉斯变换的反演定理和卷积定理,扩展了经典拉普拉斯变换的性质,用于求解扩散方程的初值边界值问题。

Comments 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12095 2026-05-13 math.AP math.OC 78%

Leak localisation with a measure source convection-diffusion model

基于测度源输运-扩散模型的泄漏定位

Thi Tam Dang, Tuomo Valkonen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究利用输运-扩散模型与测度源定位气体泄漏,通过稀疏正则化恢复点源位置与强度,联合估计风场与扩散参数,理论分析模型稳定性,数值实验验证方法在实际气体泄漏检测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12025 2026-05-13 cs.LG stat.ML 78%

Approximation Theory of Laplacian-Based Neural Operators for Reaction-Diffusion System

拉普拉斯基尔模型基于神经算子的反应扩散系统近似理论

Takashi Furuya, Ryo Ozawa, Jenn-Nan Wang

机构 * Doshisha University, RIKEN AIP(大阪大学、RIKEN AIP) Tohoku University(东北大学) National Taiwan University(国立台湾大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了基于拉普拉斯基尔模型的神经算子在反应扩散系统中的近似理论,通过分析网络深度、宽度和谱秩建立误差界,证明了该架构能缓解参数复杂性诅咒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12011 2026-05-13 physics.ins-det hep-ex hep-ph 78%

CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation

CaloArt:基于大块x预测扩散变换器的高分辨率 calorimeter shower 生成

Zhengkun Huang, Gongxing Sun

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CaloArt 通过大块x预测扩散变换器实现高分辨率 calorimeter shower 生成,有效平衡物理精度与训练推理成本,取得最佳性能。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11983 2026-05-13 cs.LG stat.ML 78%

QDSB: Quantized Diffusion Schrödinger Bridges

QDSB: 量化扩散施瓦茨里希德桥

Tobias Fuchs, Florian Kalinke, Nadja Klein

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出QDSB,通过锚点量化端点分布计算端点耦合,并通过单元采样提升到原始数据点,实现高效生成模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11925 2026-05-13 math.AP 78%

A degenerate reaction-diffusion SIR model in interconnected regions

一种退化反应扩散SIR模型在互联区域中的应用

Omar Elamraoui, Jawad Salhi, Abderrahim Zafrar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种新型的时间-空间SIR模型,用于模拟两个互联区域内的传染病动态,通过退化扩散和边界条件切换研究政策干预对疫情传播的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏