arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2605.25022 2026-05-26 cs.CV cs.AI 83%

D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation

D3S2: 扩散引导的语义分割数据集蒸馏

Wenjie Zheng, Haoji Hu, Jiali Lu, Xingze Zou, Jing Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对语义分割数据集蒸馏中的长尾类别不平衡、像素级对齐和高计算成本问题,提出两阶段框架D3S2,通过类别平衡掩码选择和扩散引导图像合成生成紧凑训练集,在极低压缩率下显著提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23902 2026-05-25 cs.CV 83%

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

PiD: 基于像素扩散的快速高分辨率潜解码

Yifan Lu, Qi Wu, Jay Zhangjie Wu, Zian Wang, Huan Ling, Sanja Fidler, Xuanchi Ren

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出像素扩散解码器PiD,将潜解码重构为条件像素扩散,统一解码与上采样,实现低延迟高分辨率图像生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/pid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22011 2026-05-22 cs.CV 83%

Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness

重新思考扩散模型的token减少:通过输出相似性意识

Hangyeol Lee, Hyojeong Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiTo,一种基于输出中心的token减少方法,通过利用相邻时间步的输出相似性来建立token对应关系,从而减少计算复杂度并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01273 2026-05-21 cs.CV 83%

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。

Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23313 2026-05-21 cs.CV 83%

The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models

伦勃朗的牛 - 分析文本到图像模型中艺术提示的解释

Alfio Ferrara, Sergio Picascia, Elisabetta Rocchetti

机构 * Department of Computer Science, Università degli Studi di Milano, Via Celoria, 18, 20133 Milan, Italy(米兰大学计算机科学系)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究了文本到图像扩散模型在生成艺术作品时如何解释内容和风格的概念,通过交叉注意力热图分析生成图像中像素与特定提示词的关联,揭示了不同艺术提示和风格下内容与风格分离的程度,为理解大规模生成模型内部如何表示复杂艺术概念提供了新见解。

Comments to be published in: Applications of AI in the Analysis of Cultural and Artistic Heritage, organized within the 35th IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20267 2026-05-21 cs.CV cs.AI 83%

Generation of Heterogeneous PET Images from Uniform Organ Activity Maps Using a Pretrained Domain-Adapted Diffusion Model

基于预训练域适应扩散模型生成异质性PET图像

Suya Li, Kaushik Dutta, Debojyoti Pal, Jingqin Luo, Kooresh I. Shoghi

机构 * Mallinckrodt Institute of Radiology, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院马林克罗德特放射医学研究所,圣路易斯,美国) Imaging Science Program, McKelvey School of Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校麦克雷高中工程学院成像科学计划,圣路易斯,美国) Department of Surgery, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院外科部,圣路易斯,美国) Department of Biomedical Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校生物医学工程部,圣路易斯,美国)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种预训练域适应扩散模型,用于从均匀器官活动图生成临床相关的异质性PET图像,通过两阶段训练策略提高合成图像的定量精度和肿瘤分割性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11688 2026-05-20 cs.LG cs.CV 83%

Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling

分层调度优化用于快速且稳健的扩散模型采样

Aihua Zhu, Rui Su, Qinglin Zhao, Li Feng, Meng Shen, Shibo He

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科学技术大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分层调度优化方法,通过改进的双层优化框架,在极低的函数评估次数下实现高效的扩散模型采样,显著提升了样本质量和计算效率。

Comments Preprint, accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17759 2026-05-19 cs.CV 83%

FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion

FrequencyBooster: 高保真像素扩散的全频建模

Lichen Ma, Zipeng Guo, Yu He, Xiaolong Fu, Luohang Liu, Jingling Fu, Junshi Huang, Yan Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FrequencyBooster,一种能够提升像素扩散模型全频建模能力的框架,通过高容量解码器提取高频细节和低频语义,从而在保持全局结构的同时实现更精确的像素生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06162 2026-05-19 cs.LG cs.CV 83%

Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models

忘却众多,忘却正确:扩散模型中可扩展且精确的概念反学习

Kaiyuan Deng, Gen Li, Yang Xiao, Bo Hui, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) Clemson University(克莱姆森大学) The University of Tulsa(塔尔萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种名为ScaPre的统一框架,用于在大规模扩散模型中实现精确的概念反学习,通过解决冲突更新、不精确机制和依赖额外数据的问题,提高了反学习的效率和精度。

Comments Accepted at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17294 2026-05-19 cs.CV 83%

HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

HierEdit: 基于区域的分层扩散用于高效的高分辨率编辑

Yuyao Zhang, Alexander Huang-Menders, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出HierEdit,一种区域感知的分层扩散框架,用于高效可扩展的高分辨率图像编辑。通过低分辨率代理生成参考并定位修改区域,结合分层局部窗口扩散模型和推理加速机制,实现无需高分辨率训练数据的快速高保真编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16873 2026-05-19 cs.CV 83%

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-05-19 cs.CV cs.AI 83%

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 17pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17352 2026-05-19 cs.CV 83%

Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey

通过强化学习和奖励建模对扩散模型的对齐与安全性:综述

Preeti Lamba, Kiran Ravish, Ankita Kushwaha, Pawan Kumar

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文综述了通过强化学习、奖励建模等方法对文本到图像扩散模型进行对齐和安全性的最新进展,探讨了反馈来源、奖励信号形式、优化机制等五个维度,并提出了多目标对齐、反馈高效偏好学习等开放性挑战。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15267 2026-05-18 cs.CV cs.AI cs.LG 83%

Autoguided Online Data Curation for Diffusion Model Training

自引导在线数据精炼用于扩散模型训练

Valeria Pais, Luis Oala, Daniele Faccio, Marco Aversa

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文研究自引导和在线数据选择方法对扩散模型训练效率的影响,通过合成数据任务验证了自引导在样本质量和多样性上的优势。

Comments Accepted non-archival paper at ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15193 2026-05-15 cs.CV 83%

Aligning Latent Geometry for Spherical Flow Matching in Image Generation

在图像生成中利用球面流匹配对潜在几何进行对齐

Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe, Adil Kaan Akan, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) fal(法尔)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过分解潜在标记为径向和角向成分,利用球面线性插值改进流匹配,使生成图像在不同分词器下提升FID评分,无需辅助编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15055 2026-05-15 cs.LG cs.CV 83%

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

DiffusionOPD:扩散模型中在线策略蒸馏的统一视角

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

机构 * Fudan University(复旦大学) Wan Team, Alibaba Group(阿里集团万团队)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffusionOPD,通过在线策略蒸馏统一多任务训练,解决多任务优化中的交叉干扰和不平衡问题,理论推导出连续状态马尔可夫过程的KL目标,实验显示其在训练效率和性能上优于多奖励RL和级联RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14894 2026-05-15 cs.CV 83%

SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer

SEDiT: 一种基于单步扩散变换器的无掩膜视频字幕擦除方法

Zheng Hui, Yunlong Bai

机构 * Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 SEDiT提出一种单步扩散变换器方法,实现无掩膜视频字幕擦除,通过理论证明和实验验证,解决字幕擦除中的局部编辑问题和长期时间一致性挑战。

Comments Project page:http://zheng222.github.io/SEDiT_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14461 2026-05-15 cs.CV 83%

ClickRemoval: An Interactive Open-Source Tool for Object Removal in Diffusion Models

ClickRemoval: 一种基于扩散模型的对象移除交互式开源工具

Ledun Zhang, Yatu Ji, Xufei Zhuang, Xinying Yao

机构 * Inner Mongolia University of Technology(内蒙古科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ClickRemoval通过用户点击实现对象移除,无需手动掩膜或文本提示,在复杂场景中实现精确移除和自然背景恢复。

Comments 5 pages, 4 figures. Open-source software paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14341 2026-05-15 cs.CV 83%

AnyBand-Diff: A Unified Remote Sensing Image Generation and Band Repair Framework with Spectral Priors

AnyBand-Diff: 一种结合光谱先验的遥感图像生成与波段修复框架

Zuopeng Zhao, Ying Liu, Xiaoyu Li, Su Luo, Lu Li, Wenwen Liu

机构 * School of Computer Science and Technology / School of Artificial Intelligence, China University of Mining and Technology(计算机科学与技术学院/人工智能学院,中国矿业大学) Mine Digitization Engineering Research Center of the Ministry of Education(教育部矿山数字化工程研究中心) Jiangsu Provincial Industrial Technology Engineering Center for Intelligent Sensing(江苏省智能感知与应急物联网地下空间工业技术工程中心)

专题命中 扩散模型 :image generation(title);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AnyBand-Diff框架,结合光谱先验指导扩散模型,解决遥感图像生成中的光谱失真问题,通过双随机掩码策略和物理引导采样机制实现可靠图像生成与准确光谱修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08698 2026-05-15 cs.CV cs.LG 83%

Supersampling Stable Diffusion and Beyond: A Seamless, Training-Free Approach for Scaling Neural Networks Using Common Interpolation Methods

超采样稳定扩散与更远:一种无缝、无需训练的方法,利用常见插值方法扩展神经网络

Md Abu Obaida Zishan, Jannatun Noor, Annajiat Alim Rasel

机构 * School of Data and Sciences BRAC University, Dhaka(数据与科学学院,布拉克大学,达卡) Computing for Sustainability and Social Good (C2SG) Research Group Department of Computer Science and Engineering United Internation University, Dhaka(可持续性与社会公益(C2SG)研究组,计算机科学与工程系,联合国际大学,达卡)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出无需训练的超采样方法,通过插值扩展神经网络以生成更高分辨率图像,同时减少内存占用。

Comments Updated the title for clarity. Removed background and redundant text from section 4.2,5. Improved organization in section 4 and clarity of text in Section 4.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV 83%

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04557 2026-05-14 cs.CV cs.AI 83%

Efficient Geometry-Controlled High-Resolution Satellite Image Synthesis

高效几何控制高分辨率卫星图像合成

Vlad Vasilescu, Daniela Faur, Teodor Costachioiu

机构 * Univ. POLITEHNICA Bucharest SIGMA Lab , CAMPUS Institute(巴比什-博亚尔银行大学 SIGMA 实验室,CAMPUS 机构) Univ. POLITEHNICA Bucharest GEOSENSE , CAMPUS Institute(巴比什-博亚尔银行大学 GEOSENSE,CAMPUS 机构)

专题命中 扩散模型 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种高效方法,通过利用跳连特征和滑动窗口交叉注意力模块,改进扩散模型以实现几何控制的高分辨率卫星图像合成,同时探讨了当前评估方法的局限性。

Comments 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13293 2026-05-14 cs.CV 83%

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

Img2CADSeq:通过序列扩散生成图像到CAD

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen

机构 * School of Software Tsinghua University China(软件学院清华大学中国) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。

Comments Accepted by SIGGRAPH 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12122 2026-05-13 cs.LG cs.AI cs.CV 83%

Disentangled Sparse Representations for Concept-Separated Diffusion Unlearning

解耦稀疏表示用于概念分离的扩散撤销

Hyeonjin Kim, Hangyeol Jung, Heechan Yun, Sungjun Yun, Dong-Jun Han

机构 * Yonsei University(延世大学) Kookmin University(韩国釜山大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SAEParate,通过概念感知对比目标解耦潜在表示,提升扩散模型中特定概念撤销的精度与效果,实验显示在联合风格-物体撤销任务中表现优异。

Comments 40 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11506 2026-05-13 cs.CV 83%

Principled Design of Diffusion-based Optimizers for Inverse Problems

基于逆问题的扩散优化器原理化设计

Julio Oscanoa, Irmak Sivgin, Cagan Alkan, Daniel Ennis, John Pauly, Mert Pilanci, Shreyas Vasanawala

机构 * Department of Bioengineering(生物工程系) Department of Radiology, Stanford University, USA(斯坦福大学放射学系,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出原理化重参数化方法,使扩散模型在逆问题中能复用超参数,提升推理速度和图像质量。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11311 2026-05-13 cs.LG cs.CV stat.CO stat.ML 83%

Couple to Control: Joint Initial Noise Design in Diffusion Models

耦合控制:扩散模型中的联合初始噪声设计

Jing Jia, Liyue Shen, Guanyang Wang

机构 * Department of Computer Science(计算机科学系) Rutgers University(罗格斯大学) Department of EECS(电子工程与计算机科学系) University of Michigan(密歇根大学) Department of Statistics(统计学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过设计多样本展厅的依赖结构来控制初始噪声,改进生成质量并提升多样性,同时支持结构化初始化。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV 83%

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22942 2026-05-12 cs.CV cs.AI cs.LG 83%

VS-DDPM: Efficient Low-Cost Diffusion Model for Medical Modality Translation

VS-DDPM:高效的低成本扩散模型用于医学模态转换

Nikoo Moradi, Gijs Luijten, Behrus Hinrichs-Puladi, Jens Kleesiek, Victor Alves, Jan Egger, André Ferreira

机构 * Center Algoritmi / LASI, University of Minho(中心Algoritmi / LASI,明霍大学) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所) Essen University Hospital (AöR)(埃森大学医院(AöR)) University of Duisburg-Essen(杜伊斯堡-埃森大学) Cancer Research Center Cologne Essen (CCCE)(科隆-埃森癌症研究中心(CCCE)) West German Cancer Center(西德癌症中心) University Hospital Essen (AöR)(埃森大学医院(AöR)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Partner site University Hospital Essen (AöR)(埃森大学医院(AöR)合作站点) Institute of Computer Graphics and Vision(计算机图形与视觉研究所) Graz University of Technology(格拉茨技术大学) Institute of Medical Informatics(医学信息学研究所) University Hospital RWTH Aachen(亚琛RWTH大学医院) Department of Oral and Maxillofacial Surgery(口腔和颌面外科部门) TU Dortmund University(多特蒙德技术大学) Center for Virtual and Extended Reality in Medicine (ZvRM)(医学虚拟和扩展现实中心(ZvRM)) Faculty of Computer Science(计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VS-DDPM模型,通过改进的去噪扩散概率模型提升医学图像生成效率与质量,在MRI缺失合成、肿瘤移除等任务中表现优异,但部分任务未达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06699 2026-05-11 eess.IV cs.AI cs.CV cs.LG 83%

Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

通过交叉注意力在联合潜在空间中利用扩散模型进行MRI和表格数据的多模态合成

Daniel Mensing, Jan Kapar, Jochen G. Hirsch, Matthias Günther, Horst Hahn, Marvin N. Wright

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Leibniz Institute for Prevention Research and Epidemiology – BIPS(莱比锡预防研究与流行病学研究所 – BIPS) Faculty of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学学院) Faculty of Physics and Electrical Engineering, University of Bremen(不莱梅大学物理与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种多模态潜在扩散模型,通过交叉注意力在共享潜在空间中联合生成MRI和临床表格数据,验证了在单一扩散框架中联合建模MRI和混合类型表格数据的可行性。

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139252D (April 03, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06070 2026-05-08 cs.CV 83%

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化

Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏