arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2603.19575 2026-03-24 cs.CV 83%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21348 2026-03-24 cs.CV 83%

Efficient Coarse-to-Fine Diffusion Models with Time Step Sequence Redistribution

高效粗到细扩散模型与时间步序列重分布

Yu-Shan Tai, An-Yeu, Wu

机构 * Graduate Institute of Electrical Engineering(电气工程研究所) National Taiwan University(台湾大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出粗到细扩散模型与时间步序列重分布方法,通过减少粗特征生成计算和优化采样轨迹,实现CIFAR10和LSUN-Church上80%-90%的计算量减少,近无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21085 2026-03-24 cs.CV 83%

Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models

通过方差扩展损失镇定采样扰动以提升潜在扩散模型

Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出方差扩展损失,通过对抗重建与方差扩展的交互,提升潜在空间鲁棒性,改进扩散生成质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10634 2026-03-24 cs.CV cs.AI 83%

Symmetrical Flow Matching: Unified Image Generation, Segmentation, and Classification with Score-Based Generative Models

对称流匹配:基于分数生成模型的统一图像生成、分割与分类

Francisco Caetano, Christiaan Viviers, Peter H. N. De With, Fons van der Sommen

专题命中 扩散模型 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出对称流匹配方法,通过联合建模正反向变换实现图像生成、分割和分类的统一,采用对称学习目标确保双向一致性并保留生成多样性,实验表明其在多个基准上取得SOTA性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19939 2026-03-23 cs.CV 83%

Timestep-Aware Block Masking for Efficient Diffusion Model Inference

基于时间步的块掩码:用于高效扩散模型推理的优化方法

Haodong He, Yuan Gao, Weizhong Zhang, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于时间步的块掩码方法,通过动态决定执行或跳过哪些块来优化预训练DPMs的计算图,提升推理效率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19676 2026-03-23 cs.CV cs.AI cs.LG 83%

ATHENA: Adaptive Test-Time Steering for Improving Count Fidelity in Diffusion Models

ATHENA: 适应性测试时引导以提高扩散模型中的计数保真度

Mohammad Shahab Sepehri, Asal Mehradfar, Berk Tinaz, Salman Avestimehr, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 ATHENA通过测试时自适应引导框架提升扩散模型中物体计数保真度,不修改模型结构或需重新训练,利用中间表示估计计数并进行噪声校正,三种变体在计算上权衡提升数值精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19195 2026-03-20 cs.CV 83%

All-in-One Slider for Attribute Manipulation in Diffusion Models

用于扩散模型属性操控的全能滑块

Weixin Ye, Hongguang Zhu, Wei Wang, Yahui Liu, Mengyu Wang, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作联合实验室) City University of Macau(澳门城市大学) Kuaishou(快手) Meitu(美图)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出All-in-One滑块模块,通过分解文本嵌入空间实现高效的属性操控,支持多属性组合与零样本操控,提升扩散模型的属性操控精度和可扩展性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18466 2026-03-20 cs.CV 83%

Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion

重新着色所关注的:通过令牌级扩散实现区域感知的着色编辑

Yuqi Yang, Dongliang Chang, Yijia Ling, Ruoyi Du, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出ColourCrafter框架,通过令牌级融合RGB颜色和图像令牌,在潜在空间中实现区域感知的着色生成,提升细粒度着色编辑的准确性和可控性。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17237 2026-03-19 cs.CV 83%

Mechanistic Interpretability of Diffusion Models: Circuit-Level Analysis and Causal Validation

扩散模型的机理可解释性:电路级分析与因果验证

Dip Roy

机构 * Computer Science and Engineering, Indian Institute of Technology, Patna, India(计算机科学与工程,印度理工学院,帕坦,印度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究通过系统干预实验揭示扩散模型在合成与自然数据处理中的算法差异,发现真实人脸处理需更高计算复杂度的电路,识别出八种功能不同的注意力机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 83%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV 83%

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14128 2026-03-17 cs.CV cs.AI cs.LG 83%

Diffusion Reinforcement Learning via Centered Reward Distillation

通过中心化奖励蒸馏实现扩散强化学习

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出中心化奖励蒸馏框架,通过KL正则化奖励最大化和前向过程微调,解决扩散模型在细粒度提示保真度、组合正确性等任务中的表现问题,实现更稳定的奖励优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03608 2026-03-17 cs.CV 83%

Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL

扩散-分类器协同:通过互boost循环实现奖励对齐学习以实现少样本类增量学习

Ruitao Wu, Yifan Zhao, Guangyao Chen, Jia Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Diffusion-Classifier Synergy框架,通过扩散模型与分类器的互boost循环,利用奖励对齐策略提升少样本类增量学习的性能,增强知识保留与新类学习能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25940 2026-03-17 cs.CV cs.LG 83%

Steer Away From Mode Collisions: Improving Composition In Diffusion Models

避免模式碰撞:改进扩散模型中的组合性能

Debottam Dutta, Jianchong Chen, Rajalaxmi Rajagopalan, Yu-Lin Wei, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过纠正采样策略改进文本到图像扩散模型中多概念提示的保真度,避免模式碰撞,提升概念平衡性和鲁棒性。

Comments Accepted to ICLR 2026. Code: https://github.com/debottam-dutta7/co3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13162 2026-03-16 eess.IV cs.CV 83%

DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression

DiT-IC:面向高效图像压缩的对齐扩散变换器

Junqi Shi, Ming Lu, Xingchen Li, Anle Ke, Ruiqi Zhang, Zhan Ma

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiT-IC,通过三种对齐机制在紧凑的潜在空间中实现高效图像压缩,显著提升解码速度和降低内存使用,实现状态领先的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14815 2026-03-16 cs.CV cs.AI cs.CE cs.LG physics.geo-ph 83%

Latent diffusion models for parameterization and data assimilation of facies-based geomodels

基于潜扩散模型的地质体参数化与数据同化

Guido Di Federico, Louis J. Durlofsky

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用潜扩散模型对基于岩性地质体进行参数化与数据同化,通过变分自编码器和U-Net实现降维与去噪,生成与参考模型一致的地质体实现。

Journal ref 10.1016/j.cageo.2024.105755

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11556 2026-03-13 cs.CV 83%

Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception

通过多模态感知引导的双条件扩散模型增强图像美学

Xinyu Nan, Ning Wang, Yuyao Zhai, Mei Yang

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出双监督图像美学增强模型DIAE,通过多模态感知和双分支监督框架提升图像美学质量与内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10445 2026-03-13 cs.LG cs.CV 83%

Unlearning the Unpromptable: Prompt-free Instance Unlearning in Diffusion Models

取消不可提示的内容:扩散模型中的无提示实例取消学习

Kyungryeol Lee, Kyeonghyun Lee, Seongmin Hong, Byung Hyun Lee, Se Young Chun

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种无提示的扩散模型实例取消学习方法,通过图像编辑、时间步加权和梯度手术,有效消除不可提示的不受欢迎输出,如面孔和文化误判,同时保持模型完整性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10780 2026-03-12 cs.CV 83%

Guiding Diffusion Models with Semantically Degraded Conditions

通过语义退化条件引导扩散模型

Shilong Han, Yuming Zhang, Hongxia Wang

机构 * College of Science, National University of Defense Technology(国防科技大学理学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过语义退化条件引导扩散模型,提升文本图像对齐与组合准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15328 2026-03-11 cs.LG cs.CV q-bio.NC 83%

Kuramoto Orientation Diffusion Models

Kuramoto方向扩散模型

Yue Song, T. Anderson Keller, Sevan Brodjian, Takeru Miyato, Yisong Yue, Pietro Perona, Max Welling

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Kuramoto方向扩散模型利用生物系统中的相位同步机制,通过周期域构建生成模型,实现对方向性图像的结构化生成。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19996 2026-03-11 cs.CV cs.AI 83%

DP-IQA: Utilizing Diffusion Prior for Blind Image Quality Assessment in the Wild

DP-IQA: 利用扩散先验进行野外盲图像质量评估

Honghao Fu, Yufei Wang, Wenhan Yang, Alex C. Kot, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) PengCheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 DP-IQA利用预训练扩散模型的先验知识,通过轻量级CNN模型提升盲图像质量评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08928 2026-03-11 cs.CV 83%

TIDE: Text-Informed Dynamic Extrapolation with Step-Aware Temperature Control for Diffusion Transformers

TIDE: 文本引导的动态外推与步感知温度控制用于扩散变换器

Yihua Liu, Fanjiang Ye, Bowen Lin, Rongyu Fang, Chengming Zhang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 TIDE通过文本锚定机制和动态温度控制,实现无需训练的高分辨率文本到图像生成,有效解决注意力稀释导致的结构退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08271 2026-03-10 cs.CV 83%

Prototype-Guided Concept Erasure in Diffusion Models

扩散模型中的原型引导概念擦除

Yuze Cai, Jiahao Lu, Hongxiang Shi, Yichao Zhou, Hong Lu

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过原型引导的方法在扩散模型中实现更可靠的概念擦除,尤其针对广义概念如性与暴力,提升图像生成的安全性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24758 2026-03-10 cs.CV 83%

ExGS: Extreme 3D Gaussian Compression with Diffusion Priors

ExGS:基于扩散先验的极端3D高斯压缩

Jiaqi Chen, Xinhao Ji, Yuanyuan Gao, Hao Li, Yuning Gong, Yifei Liu, Dan Xu, Zhihang Zhong, Dingwen Zhang, Xiao Sun

机构 * Northwestern Polytechnical University(北western工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 ExGS通过结合UGC和GaussPainter,利用扩散先验实现高效且高质量的极端3DGS压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07815 2026-03-10 cs.CV cs.AI 83%

HybridStitch: Pixel and Timestep Level Model Stitching for Diffusion Acceleration

HybridStitch: 像素和时间步级模型拼接用于扩散加速

Desen Sun, Jason Hon, Jintao Zhang, Sihang Liu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 HybridStitch通过结合大模型和小模型,实现T2I生成的高效加速,提升Stable Diffusion 3的生成速度1.83倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI 83%

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15128 2026-03-10 eess.IV cs.CV 83%

MAP-based Problem-Agnostic diffusion model for Inverse Problems

基于最大后验概率的逆问题问题无关扩散模型

Pingping Tao, Haixia Liu, Jing Su

机构 * organization= Library, Shandong University , addressline= No. 180 West Culture Road , city= Weihai , postcode= 264209 , state= Shandong , country= China organization= School of Mathematics Statistics \& Hubei Key Laboratory of Engineering Modeling Scientific Computing \& Institute of Interdisciplinary Research for Mathematics Applied Science, Huazhong University of Science organization= Department of Basic Sciences, Dalian University of Science

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大后验概率的逆问题扩散模型,通过引入高斯型先验和引导项估计,提升图像处理任务中的内容保留效果。

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15199 2026-03-10 cs.CV cs.AI cs.LG 83%

Input-Adaptive Generative Dynamics in Diffusion Models

扩散模型中的输入自适应生成动态

Yucheng Xing, Xiaodong Liu, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出了一种输入自适应的扩散模型生成方法,通过调整生成动态以适应不同输入需求,从而提升生成质量和效率。

Comments 14 pages, 6 figures. Updated version with revised title

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06533 2026-03-09 cs.CV 83%

NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion

NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学 College Park 分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。

Comments 50 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06173 2026-03-09 cs.CV 83%

Optimizing 3D Diffusion Models for Medical Imaging via Multi-Scale Reward Learning

通过多尺度奖励学习优化3D扩散模型用于医学影像

Yueying Tian, Xudong Han, Meng Zhou, Rodrigo Aviles-Espinosa, Rupert Young, Philip Birch

机构 * University of Sussex(苏塞克斯大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过多尺度奖励学习优化3D扩散模型,提升医学影像生成质量与临床应用价值。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏