arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 151 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 151 篇

2407.12173 2026-05-12 cs.CV cs.AI 89%

Beta Sampling is All You Need: Efficient Image Generation Strategy for Diffusion Models using Stepwise Spectral Analysis

贝塔采样是全部所需:利用分步频谱分析的扩散模型高效图像生成策略

Haeil Lee, Hansang Lee, Seoyeon Gye, Junmo Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于频谱分析的贝塔采样方法,优化扩散模型去噪过程,通过重点投入关键步骤提升生成效率与质量,实验显示其在FID和IS评分上优于传统均匀采样。

Comments 8 pages, 9 figures, WACV 2025

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), pp. 4215-4224, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19519 2026-05-12 cs.CV 88%

Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift

保留与个性化:无需分布偏移的个性化文本到图像扩散模型

Gihoon Kim, Hyungjin Park, Taesup Kim

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需分布偏移的个性化文本到图像扩散模型,通过引入Lipschitz正则化目标,确保参数更新时的有界偏差,从而提升视觉保真度和提示一致性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10315 2026-05-12 cs.LG cs.AI 88%

Active Tabular Augmentation via Policy-Guided Diffusion Inpainting

通过策略引导的扩散修复进行主动表格增强

Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

AI总结 本文提出TAP方法,结合扩散修复与轻量策略,提升表格增强的实用性和安全性,在数据稀缺情况下提升分类准确率和回归性能。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV 87%

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08218 2026-05-12 cs.LG cs.CV 87%

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

深度梦境由此构成:在扩散模型中可视化单义特征

Adam Szokalski, Mateusz Modrzejewski

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出通过优化的潜在可视化(LVO)技术,扩展了用于卷积神经网络的特征可视化方法至潜在扩散模型。通过稀疏自编码器(SAEs)将多义层表示分解为单义特征,展示了在Stable Diffusion 1.5模型上可视化可识别概念的效果,相比基线方法更清晰且具有相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09065 2026-05-12 cs.CV cs.LG 85%

Dependency-Aware Discrete Diffusion for Scene Graph Generation

面向依赖关系的离散扩散用于场景图生成

Rajalaxmi Rajagopalan, Romit Roy Choudhury

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种依赖感知的层次约束离散扩散模型,用于生成场景图,通过分离结构与语义,提升生成的依赖关系和层次结构,实验显示在场景图和布局指标上优于基线方法,并在多对象场景中提升图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10198 2026-05-12 cs.LG cs.AI 85%

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

空 SPACE:用于扩散模型概念擦除的交叉注意力稀疏性

Nicola Novello, Andrea M. Tonello

机构 * University of Klagenfurt(克雷格弗尔特大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SPACE方法,通过迭代修改交叉注意力参数实现概念擦除,提升大模型的擦除效果和鲁棒性,同时实现高稀疏性以降低存储需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08777 2026-05-12 stat.ML cs.LG math.PR 85%

Measuring and Decomposing Mode Separation via the Canonical Diffusion

通过规范扩散测量和分解模式分离

Shaul Tolkovsky, Ori Meidler, Or Zuk

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出通过规范扩散的自相关矩阵提取SSA和DA,用于测量模式分离,适用于高维数据和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00548 2026-05-12 cs.CV cs.GR 84%

Colorful-Noise: Training-Free Low-Frequency Noise Manipulation for Color-Based Conditional Image Generation

彩色噪声:无需训练的低频噪声操控用于基于颜色的条件图像生成

Nadav Z. Cohen, Ofir Abramovich, Ariel Shamir

机构 * Reichman University(雷曼大学)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了扩散模型输入噪声的特性,发现低频成分主导图像全局结构和颜色,高频频成分控制细节。通过低频图像先验操控低频噪声,实现无需训练的条件生成,控制整体结构和颜色,保留高频细节多样性。

Comments SIGGRAPH 2026 Conference Paper. Project Page at: https://nadavc220.github.io/colorful-noise/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV 83%

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22942 2026-05-12 cs.CV cs.AI cs.LG 83%

VS-DDPM: Efficient Low-Cost Diffusion Model for Medical Modality Translation

VS-DDPM:高效的低成本扩散模型用于医学模态转换

Nikoo Moradi, Gijs Luijten, Behrus Hinrichs-Puladi, Jens Kleesiek, Victor Alves, Jan Egger, André Ferreira

机构 * Center Algoritmi / LASI, University of Minho(中心Algoritmi / LASI,明霍大学) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所) Essen University Hospital (AöR)(埃森大学医院(AöR)) University of Duisburg-Essen(杜伊斯堡-埃森大学) Cancer Research Center Cologne Essen (CCCE)(科隆-埃森癌症研究中心(CCCE)) West German Cancer Center(西德癌症中心) University Hospital Essen (AöR)(埃森大学医院(AöR)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) Partner site University Hospital Essen (AöR)(埃森大学医院(AöR)合作站点) Institute of Computer Graphics and Vision(计算机图形与视觉研究所) Graz University of Technology(格拉茨技术大学) Institute of Medical Informatics(医学信息学研究所) University Hospital RWTH Aachen(亚琛RWTH大学医院) Department of Oral and Maxillofacial Surgery(口腔和颌面外科部门) TU Dortmund University(多特蒙德技术大学) Center for Virtual and Extended Reality in Medicine (ZvRM)(医学虚拟和扩展现实中心(ZvRM)) Faculty of Computer Science(计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出VS-DDPM模型,通过改进的去噪扩散概率模型提升医学图像生成效率与质量,在MRI缺失合成、肿瘤移除等任务中表现优异,但部分任务未达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10790 2026-05-12 cs.LG 82%

Elucidating Representation Degradation Problem in Diffusion Model Training

阐明扩散模型训练中的表示退化问题

Zhipeng Yao, Dazhou Li, Zitong Zhang, Durude Mahee, Fan Zhu, Wenbin Zhang, Xinwei He, Yeying Jin, Rui Yu

机构 * University of Louisville(路易斯维尔大学) National University of Singapore(新加坡国立大学) Florida International University(佛罗里达国际大学) Shenyang University of Chemical Technology(沈阳化学工业大学) Huazhong Agricultural University(华中农业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究扩散模型训练中的表示退化问题,提出ERD框架通过动态分配优化资源提升收敛速度和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06121 2026-05-12 cs.IR 82%

Brownian Bridge Diffusion for Sequential Recommendation

布朗桥扩散用于序列推荐

Yimeng Bai, Yang Zhang, Sihao Ding, Shaohui Ruan, Han Yao, Danhui Guan, Fuli Feng, Tat-Seng Chua

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出基于偏好桥接的扩散推荐(BBDRec),通过构建目标物品与用户历史之间的结构化扩散轨迹,改进传统基于噪声的序列推荐方法,实验表明其在多个公开数据集上表现优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09603 2026-05-12 cs.CL 82%

Edit-Based Refinement for Parallel Masked Diffusion Language Models

基于编辑的平行掩码扩散语言模型精炼

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Junting Pan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出ME-DLM框架,通过轻量级后编辑步骤提升平行生成质量与鲁棒性,基于LLaDA实现HumanEval和GSM8K性能提升。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09275 2026-05-12 cs.LG 82%

DiffATS: Diffusion in Aligned Tensor Space

DiffATS: 在对齐张量空间中的扩散

Jinhua Lyu, Tianmin Yu, Brian Kim, Lizhuo Zhou, Chanwook Park, Naichen Shi

机构 * Northwestern University(西北大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiffATS,一种基于对齐张量空间的生成框架,通过构建数据依赖的张量原始元来高效生成高分辨率时空场,实现压缩比达3.9至210倍的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08392 2026-05-12 cs.LG 82%

Geometry-Aware Discretization Error of Diffusion Models

具有几何意识的扩散模型离散化误差

Samuel Hurault, Thomas Moreau, Gabriel Peyré

机构 * Univ. Gustave Eiffel, CNRS, LIGM(法国埃菲尔大学、国家科学研究中心、LIGM实验室) Univ. Paris-Saclay, Inria, CEA(巴黎-萨克雷大学、法国国家信息与自动化技术研究院、法国原子能委员会) CNRS, ENS, PSL Université(国家科学研究中心、巴黎高等师范学院、巴黎-萨克雷大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文研究了扩散模型中离散化误差的几何适应性,通过推导Euler-Maruyama方法的弱和Fréchet离散化误差的一阶渐进行为,揭示了数据几何结构与扩散参数的交互作用,为几何感知参数优化提供可操作的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22143 2026-05-12 cs.GR cs.CV 81%

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion

JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音

Anthony Chen, Naomi Ken Korem, Gal Zeevi, Tavi Halperin, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。

Comments Project webpage available at https://justdubit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10717 2026-05-12 cs.LG cs.CV 79%

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07429 2026-05-12 cs.CV 79%

Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

通过扩散框架实现逼真且高效的bokeh渲染

Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 79%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03239 2026-05-12 cs.CV 79%

COP-GEN: Latent Diffusion Transformer for Copernicus Earth Observation Data

COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器

Miguel Espinosa, Eva Gmelich Meijling, Valerio Marsocci, Elliot J. Crowley, Mikolaj Czerkawski

机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) European Space Agency (ESA)(欧洲航天局) Asterisk Labs(Asterisk实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07756 2026-05-12 cs.CV 79%

Determinism of Randomness: Prompt-Residual Seed Shaping for Diffusion Generation

随机性的确定性:提示残差种子塑形用于扩散生成

Song Yan, Wei Zhai, Chenfeng Wang, Xinliang Bi, Jian Yang, Yancheng Cai, Yusen Zhang, Yunwei Lan, Tao Zhang, GuanYe Xiong, Min Li, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) Li Auto Inc.(利亚自动化公司) Xi’an High-tech Research Institute(西安高新技术研究院) Wechat Vision(微信视觉) Cambridge University(剑桥大学) HUST(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10071 2026-05-12 cs.CV 79%

MFVLR: Multi-domain Fine-grained Vision-Language Reconstruction for Generalizable Diffusion Face Forgery Detection and Localization

MFVLR:多领域细粒度视觉-语言重建用于通用扩散面部伪造检测与定位

Yaning Zhang, Tianyi Wang, Zan Gao, Yibo Zhao, Chunjie Ma, Meng Wang

机构 * Faculty of Computer Science and Technology, Qilu University of Technology (Shandong Academy of Sciences)(计算机科学与技术学院,齐鲁工业大学(山东省科学院)) School of Computing, National University of Singapore(国立新加坡大学计算机学院) Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences)(山东省人工智能研究院,齐鲁工业大学(山东省科学院)) Key Laboratory of Computer Vision and System, Ministry of Education, Tianjin University of Technology(教育部计算机视觉与系统重点实验室,天津工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MFVLR模型,通过语言引导的面部伪造表示学习,实现通用的扩散合成面部伪造检测与定位,结合多领域视觉编码器和细粒度语言变压器提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09688 2026-05-12 cs.CV 79%

ConFixGS: Learning to Fix Feedforward 3D Gaussian Splatting with Confidence-Aware Diffusion Priors in Driving Scenes

ConFixGS:基于置信度感知扩散先验的学习以修复馈送式3D高斯点溅射在驾驶场景中

Rui Song, Tianhui Cai, Markus Gross, Xingcheng Zhou, Zewei Zhou, Zhiyu Huang, Olaf Wysocki, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ConFixGS,通过置信度感知扩散先验学习修复馈送式3D高斯点溅射,提升稀疏视角驾驶场景中新型视角合成的鲁棒性,实验显示PSNR提升3.68dB,FID降低近一半。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09681 2026-05-12 cs.CV 79%

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

Forcing-KV:用于高效自回归视频扩散模型的混合KV缓存压缩

Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan Luo, Shuiyang Mao, Wei Liu, Huan Li

机构 * ZJU(浙江大学) Video Rebirth(视频重生) HKUST(香港科技大学) BJTU(北京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Forcing-KV方法,通过混合KV缓存压缩技术,提升自回归视频扩散模型的生成速度和内存效率,实现高达2.82倍的速度提升。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 79%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09477 2026-05-12 cs.CV cs.AI 79%

Outlier-Robust Diffusion Solvers for Inverse Problems

具有鲁棒性的扩散求解器用于逆问题

Yang Zheng, Jiahua Liu, Tongyao Pang, Wen Li, Zhaoqiang Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种鲁棒扩散求解器,通过噪声估计和Huber损失构建迭代加权最小二乘目标,以解决逆问题中的异常值问题,并在多个图像数据集上验证了其有效性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 79%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 79%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19222 2026-05-12 cs.CV cs.LG 79%

Spectrally-Guided Diffusion Noise Schedules

基于光谱引导的扩散噪声调度

Carlos Esteves, Ameesh Makadia

机构 * Google Research(谷歌研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于图像光谱特性设计实例特定噪声调度的方法,通过理论界限优化噪声级别,提升单阶段像素扩散模型生成质量,尤其在低步数情况下表现更佳。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏