arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-09 至 2026-03-09 共收录 52 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 52 篇

2603.06300 2026-03-09 cs.CV cs.LG 85%

3D CBCT Artefact Removal Using Perpendicular Score-Based Diffusion Models

使用垂直分数扩散模型进行3D锥束CT伪影去除

Susanne Schaub, Florentin Bieder, Matheus L. Oliveira, Yulan Wang, Dorothea Dagassan-Berndt, Michael M. Bornstein, Philippe C. Cattin

机构 * Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland Piracicaba Dental School, University of Campinas, Piracicaba, Brazil State Key Laboratory of Oral \& Maxillofacial Reconstruction Regeneration, Key Laboratory of Oral Biomedicine Ministry of Education, Hubei Key Laboratory of Stomatology, School \& Hospital of Stomatology, Wuhan University, Wuhan, China Dental Imaging, University Center for Dental Medicine, University of Basel, Basel, Switzerland Department of Oral Health \& Medicine, University Center for Dental Medicine, University of Basel, Basel, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于垂直分数扩散模型的3D牙科植入物修复方法,通过结合两个2D模型在投影域中操作,有效减少CBCT图像伪影,提升临床成像质量。

Comments Accepted at DGM4MICCAI 2025

Journal ref Lecture Notes in Computer Science, vol. 16128, Springer, 2025, pp. 244-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00502 2026-03-09 cs.LG 85%

Diffusion Alignment as Variational Expectation-Maximization

扩散对齐作为变分期望最大化

Jaewoo Lee, Minsu Kim, Sanghyeok Choi, Inhyuck Song, Sujin Yun, Hyeongyu Kang, Woocheol Shin, Taeyoung Yun, Kiyoung Om, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila - Quebec AI Institute(魁北克人工智能研究所) University of Edinburgh(爱丁堡大学) Mila, Université de Montréal(魁北克大学Mila) Omelet

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 DAV通过变分期望最大化框架,在文本生成和DNA设计中实现奖励优化与多样性保持。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06533 2026-03-09 cs.CV 83%

NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion

NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学 College Park 分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。

Comments 50 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06173 2026-03-09 cs.CV 83%

Optimizing 3D Diffusion Models for Medical Imaging via Multi-Scale Reward Learning

通过多尺度奖励学习优化3D扩散模型用于医学影像

Yueying Tian, Xudong Han, Meng Zhou, Rodrigo Aviles-Espinosa, Rupert Young, Philip Birch

机构 * University of Sussex(苏塞克斯大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过多尺度奖励学习优化3D扩散模型,提升医学影像生成质量与临床应用价值。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13232 2026-03-09 cs.CV 83%

MRIQT: Physics-Aware Diffusion Model for Image Quality Transfer in Neonatal Ultra-Low-Field MRI

MRIQT:面向新生儿超低场MRI的物理感知扩散模型用于图像质量迁移

Malek Al Abed, Sebiha Demir, Anne Groteklaes, Elodie Germani, Shahrooz Faghihroohi, Hemmen Sabir, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Technical University of Munich(慕尼黑技术大学) Université de Rennes(雷恩大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MRIQT通过物理感知的扩散模型实现新生儿超低场MRI到高场MRI的图像质量迁移,提升诊断准确性与病理可视化效果。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09242 2026-03-09 cs.CV 83%

NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers

NAMI: 通过桥接渐进修正流变压器实现高效的图像生成

Yuhang Ma, Bo Cheng, Shanyuan Liu, Hongyi Zhou, Liebucha Wu, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院) Tsinghua University(清华大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 NAMI通过桥接渐进修正流变压器实现高效图像生成,减少推理时间64%,并提升多分辨率训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV 83%

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04559 2026-03-09 cs.LG cs.AI 82%

Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function

通过软Q函数的重参数化策略梯度进行扩散微调

Hyeongyu Kang, Jaewoo Lee, Woocheol Shin, Kiyoung Om, Jinkyoo Park

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 SQDF通过软Q函数的重参数化策略梯度方法,解决扩散模型奖励过优化问题,提升样本多样性和自然性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06399 2026-03-09 cs.CV 79%

DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning

DiffInf: 基于影响的扩散法用于面部属性学习中的监督对齐

Basudha Pal, Rama Chellappa

机构 * Departement of Electrical and Computer Engineering(电气与计算机工程系) Departement of Biomedical Engineering(生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffInf通过自影响引导的扩散方法,修复面部属性学习中的标注不一致,提升分类泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06057 2026-03-09 cs.CV cs.AI cs.LG cs.SD 79%

TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation

TempoSyncDiff: 压缩时间一致扩散用于低延迟音频驱动说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh

机构 * Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能循环中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TempoSyncDiff通过压缩扩散模型实现低延迟音频驱动说话头生成,结合教师-学生压缩和时间正则化以提高生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV 79%

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17830 2026-03-09 cs.CV 79%

SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training

SRA 2: 变分自编码器自表示对齐用于高效的扩散训练

Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li, Yucheng Lin, Guojiang Shen, Xiangjie Kong, Yong Liu, Guang Dai, Jingdong Wang

机构 * Zhejiang University of Technology(浙江工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University(浙江大学) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SRA 2通过利用预训练变分自编码器特征,提供一种轻量级的内在引导框架,提升扩散模型的生成质量和训练效率,仅增加4%的计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19319 2026-03-09 cs.CV 79%

SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis

SyncMV4D: 同步多视角联合生成外观与运动的 hand-object 交互合成

Lingwei Dang, Zonghan Li, Juntong Li, Hongwen Zhang, Liang An, Yebin Liu, Qingyao Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SyncMV4D通过联合生成多视角手-物体交互视频和4D运动,提升了视觉真实性和运动合理性。

Comments The structure and logic of writing will undergo a complete revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15335 2026-03-09 cs.CV cs.AI 79%

ExDD: Explicit Dual Distribution Learning for Surface Defect Detection via Diffusion Synthesis

ExDD:通过扩散合成实现表面缺陷检测的显式双分布学习

Muhammad Aqeel, Federico Leonardi, Francesco Setti

机构 * Dept. of Engineering for Innovation Medicine, University of Verona(创新医学工程系,威尼斯大学) Qualyco S.r.l.(Qualyco公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ExDD通过显式建模双分布和潜在扩散模型生成合成缺陷,提升工业表面缺陷检测的准确率和鲁棒性。

Comments Accepted to ICIAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18663 2026-03-09 cs.CV 79%

DVD-Quant: Data-free Video Diffusion Transformers Quantization

DVD-Quant: 数据无依赖的视频扩散变换器量化

Zhiteng Li, Hanxuan Li, Junyi Wu, Kai Liu, Haotong Qin, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DVD-Quant通过无数据量化框架实现视频DiT模型的高效量化,提升运行速度并保持视觉质量。

Comments Code and models will be available at https://github.com/lhxcs/DVD-Quant

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19509 2026-03-09 cs.CV cs.LG cs.SD eess.AS 79%

Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis

Ditto:用于可控实时说话头合成的运动空间扩散

Tianqi Li, Ruobing Zheng, Minghui Yang, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Ditto通过运动空间扩散模型实现可控实时说话头合成,优化架构与训练策略以提升生成质量与实时性能。

Comments Project Page: https://digital-avatar.github.io/ai/Ditto/

Journal ref ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06519 2026-03-09 math.AP math-ph math.MP 78%

Lie symmetry method for a nonlinear heat-diffusion equation

非线性热扩散方程的对称方法

Julieta Bollati, Ernesto A. Borrego Rodriguez, Adriana C. Briozzo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文利用李对称方法研究非线性热扩散方程,通过确定对称性来简化方程并构造不变解,特别分析了风暴型材料和幂律依赖情况下的相似解。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06508 2026-03-09 cs.LG 78%

When One Modality Rules Them All: Backdoor Modality Collapse in Multimodal Diffusion Models

当一种模态统治一切:多模态扩散模型中的后门模态崩溃

Qitong Wang, Haoran Dai, Haotian Zhang, Christopher Rasmussen, Binghui Wang

机构 * University of Delaware(德克萨斯大学) Illinois Institute of Technology(伊利诺伊理工学院) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了多模态扩散模型中后门攻击的模态崩溃现象,发现攻击常依赖单一模态,跨模态交互反而降低攻击效果,揭示了现有评估的盲点。

Comments Accepted to the ICLR 2026 Workshop on Principled Design for Trustworthy AI. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06414 2026-03-09 math.AP 78%

Long-time behaviour of a nonlocal stochastic fractional reaction--diffusion equation arising in tumour dynamics

非局部随机分数反应-扩散方程的长期行为:源自肿瘤动力学

Nikos I. Kavallaris, Subramani Sankar, Manil T. Mohan, Christos V. Nikolopoulos, Shanmugasundaram Karthikeyan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了源于肿瘤动力学的非局部随机分数反应-扩散方程的长期行为,通过分析噪声对肿瘤扩散和灭绝的影响,揭示了异常扩散与分数噪声的相互作用机制。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13327 2026-03-09 cs.AI 78%

PepEDiff: Zero-Shot Peptide Binder Design via Protein Embedding Diffusion

PepEDiff:通过蛋白质嵌入扩散进行零样本肽结合剂设计

Po-Yu Liang, Tibo Duran, Jun Bai

机构 * Department of Computer Science, University of Cincinnati, Ohio, United States(计算机科学系,辛辛那提大学,俄亥俄州,美国) Department of Microbiology and Plant Pathology, University of California, Riverside, California, United States(微生物学与植物病理学系,加州大学河滨分校,加利福尼亚州,美国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PepEDiff通过蛋白质嵌入扩散生成零样本肽结合剂,无需依赖结构预测,提升序列和结构多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06397 2026-03-09 cs.IR cs.LG 78%

Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion

通过强化学习编译扩散实现高效、属性对齐的扇出检索

Pengcheng Jiang, Judith Yue Li, Moonkyung Ryu, R. Lily Hu, Kun Su, Zhong Yi Wan, Liam Hebert, Hao Peng, Jiawei Han, Dima Kuzmin, Craig Boutilier

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 R4T通过强化学习编译扩散模型,实现高效且属性对齐的扇出检索,提升检索质量并显著降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06364 2026-03-09 astro-ph.IM 78%

Generation of Imaging Air Cherenkov Telescope images using Diffusion Models

利用扩散模型生成成像空气切伦科夫望远镜图像

Christian Elflein, Stefan Funk, Jonas Glombitza, Vinicius Mikuni, Benjamin Nachman, Lark Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文首次应用基于分数的扩散模型生成 IACT 图像,实现了对 γ 射线和质子 shower 的高质量模拟,优于 GAN 方法,为快速仪器响应生成和探测器优化提供了新途径。

Comments 31 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06123 2026-03-09 cs.CL cs.LG 78%

Diffusion Language Models Are Natively Length-Aware

扩散语言模型天生具有长度感知能力

Vittorio Rossi, Giacomo Cirò, Davide Beltrame, Luca Gandolfi, Paul Röttger, Dirk Hovy

机构 * Department of Computing Sciences, Bocconi University, Milan, Italy(计算机科学系,博科尼大学,米兰,意大利)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过动态裁剪上下文窗口减少扩散语言模型生成步骤,从而提升效率并减少计算消耗,在多个基准测试中实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06113 2026-03-09 cs.LG physics.chem-ph 78%

Latent Diffusion-Based 3D Molecular Recovery from Vibrational Spectra

基于潜在扩散模型的振动光谱中3D分子重构

Wenjin Wu, Aleš Leonardis, Linjiang Chen, Jianbo Jiao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出IR-GeoDiff模型,通过整合光谱信息恢复红外光谱对应的三维分子几何结构,展示了其在分子重构中的有效性。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05567 2026-03-09 cs.LG 78%

FuseDiff: Symmetry-Preserving Joint Diffusion for Dual-Target Structure-Based Drug Design

FuseDiff: 保留对称性的双目标结构导向药物设计联合扩散

Jianliang Wu, Anjie Qiao, Zhen Wang, Zhewei Wei, Sheng Chen

机构 * Sun Yat-sen University(中山大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FuseDiff通过端到端扩散模型联合生成双目标结合姿态,保留对称性并实现高精度药物设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06261 2026-03-09 cs.RO 78%

Safe Model Predictive Diffusion with Shielding

安全模型预测扩散与防护

Taekyung Kim, Keyvan Majd, Hideki Okamoto, Bardh Hoxha, Dimitra Panagou, Georgios Fainekos

机构 * University of Michigan(密歇根大学) Toyota Motor North America, Research & Development(丰田北美公司,研发部门)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Safe MPD是一种无需训练的扩散规划器,通过结合基于模型的扩散框架和安全防护,生成安全且动力学可行的轨迹,显著提升规划效率和安全性。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA). Project page: https://www.taekyung.me/safe-mpd

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05664 2026-03-09 cs.LG 78%

KLASS: KL-Guided Fast Inference in Masked Diffusion Models

KLASS: 在掩码扩散模型中基于KL的快速推理

Seo Hyun Kim, Sunwoo Hong, Hojung Jung, Youngrok Park, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 KLASS通过利用令牌级KL散度实现快速稳定生成,显著提升扩散模型推理速度并保持高质量输出。

Comments NeurIPS 2025 Spotlight. Code: https://github.com/shkim0116/KLASS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23405 2026-03-09 cs.LG 78%

Planner Aware Path Learning in Diffusion Language Models Training

扩散语言模型训练中的规划感知路径学习

Fred Zhangzhi Peng, Zachary Bezemek, Jarrid Rector-Brooks, Shuibai Zhang, Anru R. Zhang, Michael Bronstein, Alexander Tong, Avishek Joey Bose

机构 * Duke University(杜克大学) Mila Université de Montréal(蒙特利尔大学) California Institute of Technology(加州理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Oxford(牛津大学) AITHYRA Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PAPL,一种通过规划感知路径学习提升扩散语言模型训练与推理一致性的方法,实现跨领域性能提升。

Comments Camera ready version for ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16861 2026-03-09 q-bio.BM cs.LG physics.bio-ph 78%

BInD: Bond and Interaction-generating Diffusion Model for Multi-objective Structure-based Drug Design

BInD:基于多目标结构的药物设计的结合与相互作用生成扩散模型

Joongwon Lee, Wonho Zhung, Jisu Seo, Woo Youn Kim

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 BInD通过结合知识引导的扩散模型,实现多目标结构导向药物设计,平衡分子相互作用、性质和几何,提升药物结合特异性。

Comments Published in Advanced Science 12(35), e02702 (2025)

Journal ref Advanced Science 12(35), e02702 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06408 2026-03-09 cs.CV cs.AI cs.GR 62%

Physical Simulator In-the-Loop Video Generation

物理模拟器闭环视频生成

Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Singapore University of Technology and Design(新加坡科技设计大学) A*STAR(新加坡科技研究局) Google(谷歌) Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence(斯图加特视觉计算、交互与人工智能研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 PSIVG通过整合物理模拟器与扩散模型,生成符合物理规律的视频,提升生成视频的真实性和一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏