arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 206 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2603.00918 2026-05-12 cs.CV cs.AI 88%

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25074 2026-05-12 cs.CV 85%

Z-Erase: Enabling Concept Erasure in Single-Stream Diffusion Transformers

Z-Erase:在单流扩散变换器中实现概念擦除

Nanxiang Jiang, Zhaoxin Fan, Baisen Wang, Daiheng Gao, Junhang Cheng, Jifeng Guo, Yalan Qin, Yeying Jin, Hongwei Zheng, Faguo Wu, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算北京创新中心) Privacy Computing, School of Artificial Intelligence, Beihang University(隐私计算,北京航空航天大学人工智能学院) University of Science(科学大学) Shanghai University(上海大学) Tencent(腾讯) Beijing Academy of Blockchain(北京区块链研究院)

专题命中 文生图 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Z-Erase,一种专为单流T2I模型设计的概念擦除方法,通过解耦更新和平衡擦除与保留的权衡,解决生成崩溃问题,实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR 83%

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 79%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16836 2026-05-12 cs.CV cs.CL 79%

ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models

ColorConceptBench:一种用于文本到图像模型中概率颜色-概念理解的基准

Chenxi Ruan, Yihan Hou, Yu Xiao, Guosheng Hu, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Academy of Art(中国美术学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出ColorConceptBench,通过概率颜色分布系统评估颜色-概念关联,研究文本到图像模型对隐含概念如情感和视觉状态的理解能力,发现模型在抽象语义上的敏感性不足。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08836 2026-05-12 cs.MM 57%

Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning

通过自适应条件卸载和剪枝加速多条件T2I生成

Yuxin Kong, Peng Yang, Chongbin Yi, Fan Wu, Feng Lyu

专题命中 文生图 :text-to-image(abstract);分类 cs.MM

AI总结 本文提出一种端边协作系统,通过自适应条件卸载和剪枝减少多条件T2I生成的延迟并提升生成质量。

Comments accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-05-12 cs.CV 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 57%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08280 2026-05-12 cs.LG cs.AI 50%

Beyond the False Trade-off: Adaptive EWC for Stealthy and Generalizable T2I Backdoors

超越虚假的权衡:适应性EWC用于隐蔽且可泛化的T2I后门

Lu Bowen, Xinyu Tang, Yin Yin Low, Shu-Min Leong

机构 * Monash University(墨尔本大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出Cosine-Aware Adaptive EWC,通过动态调整EWC正则化提升T2I后门攻击的ASR与模型保真度平衡,增强对域外数据集的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 8 篇

2605.10600 2026-05-12 cs.CR 87%

Generate "Normal", Edit Poisoned: Branding Injection via Hint Embedding in Image Editing

生成“正常”,编辑污染:通过提示嵌入的品牌注入图像编辑

Desen Sun, Jason Hon, Howe Wang, Saarth Rajan, Meng Xu, Sihang Liu

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 研究发现图像编辑流程中存在安全漏洞,通过隐含提示注入品牌信息可实现隐蔽攻击,提出针对两种攻击场景的缓解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10859 2026-05-12 cs.CV cs.LG 83%

Masked Generative Transformer Is What You Need for Image Editing

你需要Masked Generative Transformer来进行图像编辑

Wei Chow, Linfeng Li, Xian Sun, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) HKUST(GZ)(香港科技大学(广州))

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度,使用CrispEdit-2M数据集在多个基准上取得最佳性能。

Comments CVPR 2026 HiGen Workshop; Project Page at https://weichow23.github.io/EditMGT/ GitHub at https://github.com/weichow23/EditMGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10319 2026-05-12 cs.CV 83%

LimeCross: Context-Conditioned Layered Image Editing with Structural Consistency

LimeCross:基于结构一致性的上下文条件分层图像编辑

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Ko Watanabe, Riku Takahashi, Issey Sukeda, Andreas Dengel

机构 * RPTU Kaiserslautern-Landau \& DFKI GmbH, Kaiserslautern, Germany Faculty of Science Engineering, Hosei University, Tokyo, Japan EQUES, Tokyo, Japan

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LimeCross通过上下文条件分层图像编辑框架,实现基于文本的可控编辑,保持结构一致性,提升图像合成的真实性和透明度稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10730 2026-05-12 cs.CV 77%

Qwen-Image-2.0 Technical Report

Qwen-Image-2.0 技术报告

Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai

机构 * Qwen Team(通义实验室)

专题命中 图像编辑 :image generation(abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 75%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV 57%

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR 57%

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08167 2026-05-12 cs.CV cs.AI 57%

Digital Image Forgery Detection Using Transfer Learning

利用迁移学习的数字图像伪造检测

Fatma Betul Buyuk, Gozde Karatas Baydogmus, Ali Buldu, Ayaulym Tulendiyeva, Zhuldyz Baizhumanova

机构 * Marmara University, Department of Computer Engineering(马尔马拉大学计算机工程系) Loyola University Chicago, Department of Computer Science(芝加哥洛伊拉大学计算机科学系) Biruni University, Department of Computer Engineering(比鲁尼大学计算机工程系)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出一种基于迁移学习的数字图像伪造检测框架,结合压缩感知特征增强与深度卷积神经网络,通过混合输入表示和自适应阈值优化策略提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 151 篇

2407.12173 2026-05-12 cs.CV cs.AI 89%

Beta Sampling is All You Need: Efficient Image Generation Strategy for Diffusion Models using Stepwise Spectral Analysis

贝塔采样是全部所需:利用分步频谱分析的扩散模型高效图像生成策略

Haeil Lee, Hansang Lee, Seoyeon Gye, Junmo Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于频谱分析的贝塔采样方法,优化扩散模型去噪过程,通过重点投入关键步骤提升生成效率与质量,实验显示其在FID和IS评分上优于传统均匀采样。

Comments 8 pages, 9 figures, WACV 2025

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pp. 4215-4224, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19519 2026-05-12 cs.CV 88%

Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift

保留与个性化:无需分布偏移的个性化文本到图像扩散模型

Gihoon Kim, Hyungjin Park, Taesup Kim

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需分布偏移的个性化文本到图像扩散模型,通过引入Lipschitz正则化目标,确保参数更新时的有界偏差,从而提升视觉保真度和提示一致性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10315 2026-05-12 cs.LG cs.AI 88%

Active Tabular Augmentation via Policy-Guided Diffusion Inpainting

通过策略引导的扩散修复进行主动表格增强

Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本文提出TAP方法,结合扩散修复与轻量策略,提升表格增强的实用性和安全性,在数据稀缺情况下提升分类准确率和回归性能。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV 87%

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08218 2026-05-12 cs.LG cs.CV 87%

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

深度梦境由此构成:在扩散模型中可视化单义特征

Adam Szokalski, Mateusz Modrzejewski

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出通过优化的潜在可视化(LVO)技术,扩展了用于卷积神经网络的特征可视化方法至潜在扩散模型。通过稀疏自编码器(SAEs)将多义层表示分解为单义特征,展示了在Stable Diffusion 1.5模型上可视化可识别概念的效果,相比基线方法更清晰且具有相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09065 2026-05-12 cs.CV cs.LG 85%

Dependency-Aware Discrete Diffusion for Scene Graph Generation

面向依赖关系的离散扩散用于场景图生成

Rajalaxmi Rajagopalan, Romit Roy Choudhury

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种依赖感知的层次约束离散扩散模型,用于生成场景图,通过分离结构与语义,提升生成的依赖关系和层次结构,实验显示在场景图和布局指标上优于基线方法,并在多对象场景中提升图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10198 2026-05-12 cs.LG cs.AI 85%

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

空 SPACE:用于扩散模型概念擦除的交叉注意力稀疏性

Nicola Novello, Andrea M. Tonello

机构 * University of Klagenfurt(克雷格弗尔特大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SPACE方法,通过迭代修改交叉注意力参数实现概念擦除,提升大模型的擦除效果和鲁棒性,同时实现高稀疏性以降低存储需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08777 2026-05-12 stat.ML cs.LG math.PR 85%

Measuring and Decomposing Mode Separation via the Canonical Diffusion

通过规范扩散测量和分解模式分离

Shaul Tolkovsky, Ori Meidler, Or Zuk

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出通过规范扩散的自相关矩阵提取SSA和DA,用于测量模式分离,适用于高维数据和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00548 2026-05-12 cs.CV cs.GR 84%

Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation

彩色噪声:无需训练的低频噪声操控用于基于颜色的条件图像生成

Nadav Z. Cohen, Ofir Abramovich, Ariel Shamir

机构 * Reichman University(雷曼大学)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了扩散模型输入噪声的特性,发现低频成分主导图像全局结构和颜色,高频频成分控制细节。通过低频图像先验操控低频噪声,实现无需训练的条件生成,控制整体结构和颜色,保留高频细节多样性。

Comments SIGGRAPH 2026 Conference Paper. Project Page at: https://nadavc220.github.io/colorful-noise/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV 83%

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22942 2026-05-12 cs.CV cs.AI cs.LG 83%

VS-DDPM: Efficient Low-Cost Diffusion Model for Medical Modality Translation

VS-DDPM:高效的低成本扩散模型用于医学模态转换

Nikoo Moradi, Gijs Luijten, Behrus Hinrichs-Puladi, Jens Kleesiek, Victor Alves, Jan Egger, André Ferreira

机构 * Center Algoritmi / LASI, University of Minho(中心Algoritmi / LASI,明霍大学) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所) Essen University Hospital (AöR)(埃森大学医院(AöR)) University of Duisburg-Essen(杜伊斯堡-埃森大学) Cancer Research Center Cologne Essen (CCCE)(科隆-埃森癌症研究中心(CCCE)) West German Cancer Center(西德癌症中心) University Hospital Essen (AöR)(埃森大学医院(AöR)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Partner site University Hospital Essen (AöR)(埃森大学医院(AöR)合作站点) Institute of Computer Graphics and Vision(计算机图形与视觉研究所) Graz University of Technology(格拉茨技术大学) Institute of Medical Informatics(医学信息学研究所) University Hospital RWTH Aachen(亚琛RWTH大学医院) Department of Oral and Maxillofacial Surgery(口腔和颌面外科部门) TU Dortmund University(多特蒙德技术大学) Center for Virtual and Extended Reality in Medicine (ZvRM)(医学虚拟和扩展现实中心(ZvRM)) Faculty of Computer Science(计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VS-DDPM模型,通过改进的去噪扩散概率模型提升医学图像生成效率与质量,在MRI缺失合成、肿瘤移除等任务中表现优异,但部分任务未达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10790 2026-05-12 cs.LG 82%

Elucidating Representation Degradation Problem in Diffusion Model Training

阐明扩散模型训练中的表示退化问题

Zhipeng Yao, Dazhou Li, Zitong Zhang, Durude Mahee, Fan Zhu, Wenbin Zhang, Xinwei He, Yeying Jin, Rui Yu

机构 * University of Louisville(路易斯维尔大学) National University of Singapore(新加坡国立大学) Florida International University(佛罗里达国际大学) Shenyang University of Chemical Technology(沈阳化学工业大学) Huazhong Agricultural University(华中农业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散模型训练中的表示退化问题,提出ERD框架通过动态分配优化资源提升收敛速度和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06121 2026-05-12 cs.IR 82%

Brownian Bridge Diffusion for Sequential Recommendation

布朗桥扩散用于序列推荐

Yimeng Bai, Yang Zhang, Sihao Ding, Shaohui Ruan, Han Yao, Danhui Guan, Fuli Feng, Tat-Seng Chua

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出基于偏好桥接的扩散推荐(BBDRec),通过构建目标物品与用户历史之间的结构化扩散轨迹,改进传统基于噪声的序列推荐方法,实验表明其在多个公开数据集上表现优越。

详情

展开后加载摘要…

URL PDF HTML 收藏