arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-17 至 2026-03-17 共收录 125 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 125 篇

2603.03125 2026-03-17 cs.CV 86%

AWDiff: An a trous wavelet diffusion model for lung ultrasound image synthesis

AWDiff:一种用于肺部超声图像合成的a trous小波扩散模型

Maryam Heidari, Nantheera Anantrasirichai, Steven Walker, Rahul Bhatnagar, Alin Achim

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出AWDiff模型,通过a trous小波变换与BioMedCLIP语义条件,提升肺部超声图像生成的结构精度与临床相关性。

Comments 5 pages5 pages, 4 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13396 2026-03-17 cs.CV 86%

SERUM: Simple, Efficient, Robust, and Unifying Marking for Diffusion-based Image Generation

SERUM:一种简单、高效、鲁棒且统一的扩散图像生成标记方法

Jan Kociszewski, Hubert Jastrzębski, Tymoteusz Stępkowski, Filip Manijak, Krzysztof Rojek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 情报安全中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV

AI总结 SERUM通过在扩散模型生成的初始噪声中添加唯一水印噪声,并训练轻量级检测器识别水印图像,实现了高效且鲁棒的图像标记,同时保持图像质量影响极小。

Comments Accepted as an ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19917 2026-03-17 cs.CV 85%

Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models

在关键区域进行扩展:无需训练的扩散模型局部化扩展

Qin Ren, Yufei Wang, Lanqing Guo, Wen Zhang, Zhiwen Fan, Chenyu You

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LoTTS,一种无需训练的局部化测试时扩展方法,通过局部重采样缺陷区域提升图像质量并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14062 2026-03-17 cs.CV cs.LG 85%

TMPDiff: Temporal Mixed-Precision for Diffusion Models

TMPDiff:扩散模型的时序混合精度

Basile Lewandowski, Simon Kurz, Aditya Shankar, Robert Birke, Jian-Jia Chen, Lydia Y. Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TMPDiff通过为不同去噪时间步分配不同精度,优化扩散模型的推理效率,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22524 2026-03-17 cs.LG 85%

Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design

通过重要加权和最优提案设计实现离散扩散模型的推理时间扩展

Zijing Ou, Chinmay Pani, Yingzhen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于SMC框架的重要加权和最优提案设计方法,提升离散扩散模型在推理时的可控制性和样本质量,适用于多个领域任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13739 2026-03-17 cs.CV cs.AI cs.MM 84%

UniVid: Pyramid Diffusion Model for High Quality Video Generation

UniVid:金字塔扩散模型用于高质量视频生成

Xinyu Xiao, Binbin Yang, Tingtian Li, Yipeng Yu, Sen Lei

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05823 2026-03-17 cs.CV 83%

Boosting Latent Diffusion Models via Disentangled Representation Alignment

通过解耦表征对齐提升潜在扩散模型

John Page, Xuesong Niu, Kai Wu, Kun Gai

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Semantics-Disentangled VAE,通过非线性映射架构提升VAE的语义解耦能力,实现高质量图像生成,FID达1.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18706 2026-03-17 cs.CV 83%

CoD: A Diffusion Foundation Model for Image Compression

CoD:一种面向图像压缩的扩散基础模型

Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出CoD,一种面向图像压缩的扩散基础模型,通过端到端优化提升压缩效率和生成质量,在超低比特率下实现SOTA结果,同时降低训练成本并提供新研究视角。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14128 2026-03-17 cs.CV cs.AI cs.LG 83%

Diffusion Reinforcement Learning via Centered Reward Distillation

通过中心化奖励蒸馏实现扩散强化学习

Yuanzhi Zhu, Xi Wang, Stéphane Lathuilière, Vicky Kalogeiton

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出中心化奖励蒸馏框架,通过KL正则化奖励最大化和前向过程微调,解决扩散模型在细粒度提示保真度、组合正确性等任务中的表现问题,实现更稳定的奖励优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03608 2026-03-17 cs.CV 83%

Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL

扩散-分类器协同:通过互boost循环实现奖励对齐学习以实现少样本类增量学习

Ruitao Wu, Yifan Zhao, Guangyao Chen, Jia Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Diffusion-Classifier Synergy框架,通过扩散模型与分类器的互boost循环,利用奖励对齐策略提升少样本类增量学习的性能,增强知识保留与新类学习能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25940 2026-03-17 cs.CV cs.LG 83%

Steer Away From Mode Collisions: Improving Composition In Diffusion Models

避免模式碰撞:改进扩散模型中的组合性能

Debottam Dutta, Jianchong Chen, Rajalaxmi Rajagopalan, Yu-Lin Wei, Romit Roy Choudhury

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过纠正采样策略改进文本到图像扩散模型中多概念提示的保真度,避免模式碰撞,提升概念平衡性和鲁棒性。

Comments Accepted to ICLR 2026. Code: https://github.com/debottam-dutta7/co3

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08801 2026-03-17 cs.CV cs.AI cs.MM 81%

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成

Hangjie Yuan, Weihua Chen, Jun Cen, Hu Yu, Jingyun Liang, Shuning Chang, Zhihui Lin, Tao Feng, Pengwei Liu, Jiazheng Xing, Hao Luo, Jiasheng Tang, Fan Wang, Yi Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV 79%

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15365 2026-03-17 cs.CV 79%

A PPO-Based Bitrate Allocation Conditional Diffusion Model for Remote Sensing Image Compression

基于PPO的比特率分配条件扩散模型用于遥感图像压缩

Yuming Han, Jooho Kim, Anish Shakya

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Institute for a Disaster Resilient Texas(灾难韧性德克萨斯研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于PPO的条件扩散压缩框架,结合条件扩散解码器与块级比特率分配策略,实现高压缩比和强感知性能,并发布高分辨率无人机图像数据集,实验显示在DIV2K和无人机图像数据集上分别达到19.3x和21.2x的压缩比,下游目标检测实验表明重建图像保持任务相关信息且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15267 2026-03-17 cs.CV 79%

Exemplar Diffusion: Improving Medical Object Detection with Opportunistic Labels

示例扩散:利用机会性标签改进医学目标检测

Victor Wåhlstrand, Jennifer Alvén, Ida Häggström

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种利用推理时现有标签(示例)提升医学图像目标检测性能的方法,通过无需训练的扩散方法增强已知边界框信息,提高检测精度和鲁棒性,并量化预测不确定性。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14885 2026-03-17 cs.CV 79%

SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras

SpiralDiff: 基于LoRA的Spiral扩散用于跨相机的RGB到RAW转换

Huanjing Yue, Shangbin Xie, Cong Cao, Qian Wu, Lei Zhang, Lei Zhao, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) State key laboratory of Smart Power Distribution Equipment and System, Tianjin University(天津大学智能电力分配设备与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpiralDiff通过信号依赖噪声加权策略和CamLoRA模块,提升跨相机RGB到RAW转换的重建质量及下游任务性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14819 2026-03-17 cs.CV cs.AI 79%

RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models

RAZOR:面向视觉变换器和扩散模型的比率感知层编辑以实现针对性遗忘

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RAZOR通过比率感知机制实现视觉变换器和扩散模型的针对性遗忘,通过多层和多头编辑提升模型安全性与合规性,实现高效且稳定的遗忘更新。

Comments 18 pages, 6 figures, 8 tables, accepted to the CVPR 2026 and to appear in the Findings Track Proceedings of IEEE/CVF Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14704 2026-03-17 cs.LG cs.CV stat.ML 79%

Chain-of-Trajectories: Unlocking the Intrinsic Generative Optimality of Diffusion Models via Graph-Theoretic Planning

轨迹链:通过图论规划解锁扩散模型的内在生成最优性

Ping Chen, Xiang Liu, Xingpeng Zhang, Fei Shen, Xun Gong, Zhaoxiang Liu, Zezhou Chen, Huan Hu, Kai Wang, Shiguo Lian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轨迹链框架,通过图论规划解决扩散模型在高维状态空间中的计算瓶颈,提升生成质量与稳定性。

Comments 12 figues, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14702 2026-03-17 cs.CV 79%

Fractal Autoregressive Depth Estimation with Continuous Token Diffusion

分形自回归深度估计与连续令牌扩散

Jinchang Zhang, Xinrou Kang, Guoyu Lu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种分形视觉自回归扩散框架,通过粗到细的自回归生成过程改进单目深度估计,采用多尺度特征融合和连续空间去噪扩散损失提升跨模态条件化效果,同时通过分形递归架构和不确定性感知共识聚合方案提高计算效率与预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14667 2026-03-17 cs.CV cs.AI 79%

Comparative Analysis of 3D Convolutional and 2.5D Slice-Conditioned U-Net Architectures for MRI Super-Resolution via Elucidated Diffusion Models

3D卷积与2.5D切片条件化U-Net架构在MRI超分辨率中的比较分析:通过阐明扩散模型

Hendrik Chiche, Ludovic Corcos, Logan Rouge

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了3D卷积U-Net与2.5D切片条件化U-Net架构,利用阐明扩散模型提升MRI超分辨率,3D模型在PSNR、SSIM和LPIPS指标上均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14645 2026-03-17 cs.CV 79%

Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion

频谱匹配:一种提升潜在扩散扩散性的统一视角

Mang Ning, Mingxiao Li, Le Zhang, Lanmiao Liu, Matthew B. Blaschko, Albert Ali Salah, Itir Onal Ertugrul

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了变分自编码器在潜在扩散中的扩散性,提出频谱匹配假设,通过频谱匹配提升潜在扩散性,并在多个数据集上验证了其有效性。

Comments We use NIPS template for readability reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14503 2026-03-17 cs.CV astro-ph.CO 79%

Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models

通过物理引导的扩散模型映射暗物质簇

Diego Royo, Brandon Zhao, Adolfo Muñoz, Diego Gutierrez, Katherine L. Bouman

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种自动重建星系团表面质量密度的方法,利用DarkClusters-15k数据集和扩散模型,在无需专家调参的情况下实现高精度质量重建。

Comments 22 pages, 7 figures. Project page available at: https://graphics.unizar.es/projects/DarkMatterMapping

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14320 2026-03-17 cs.CV 79%

Early Failure Detection and Intervention in Video Diffusion Models

视频扩散模型中的早期故障检测与干预

Kwon Byung-Ki, Sohwi Lim, Nam Hyeon-Woo, Moon Ye-Bin, Tae-Hyun Oh

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种用于视频扩散模型的早期故障检测与干预方法,通过实时检查模块在生成过程中快速检测故障并提前干预,减少计算开销,提升生成质量。

Comments 29 pages, 24 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14220 2026-03-17 cs.CV 79%

FIND: A Simple yet Effective Baseline for Diffusion-Generated Image Detection

FIND: 一种简单而有效的扩散生成图像检测基线

Jie Li, Yingying Feng, Chi Xie, Jie Hu, Lei Tan, Jiayi Ji

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FIND方法,通过在真实图像上添加高斯噪声并标记为合成图像,利用分布差异提升检测性能,比现有方法快126倍,提升11.7%。

Comments AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14207 2026-03-17 cs.CV cs.AI 79%

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

DualTSR:统一的双扩散变压器用于场景文本图像超分辨率

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DualTSR通过统一的双扩散目标解决文本图像超分辨率中的文本先验依赖和复杂架构问题,采用单多模态Transformer骨干网络,实现视觉与文本信息的交互,提升超分辨率效果与文本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13943 2026-03-17 cs.CV cs.LG 79%

Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing

Sat-JEPA-Diff: 联合自监督学习与生成扩散模型以实现遥感图像预测

Kursat Komurcu, Linas Petkevicius

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Sat-JEPA-Diff,结合自监督学习与隐藏扩散模型,解决遥感图像预测中结构准确与纹理细节的平衡问题,实现高精度纹理生成与结构预测的结合。

Comments ICLR 2026 Workshop ML4RS Main Track: https://openreview.net/forum?id=WBHfQLbgZR

Journal ref 4th ICLR 2026 Workshop on Machine Learning for Remote Sensing (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07234 2026-03-17 cs.CV 79%

Single Image Super-Resolution via Bivariate `A Trous Wavelet Diffusion

通过双变量A Trous小波扩散实现单图像超分辨率

Maryam Heidari, Nantheera Anantrasirichai, Alin Achim

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BATDiff模型,通过双变量跨尺度模块提升超分辨率中高频细节的结构一致性和质量,实验表明其在标准基准上优于现有方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01478 2026-03-17 cs.CV cs.AI cs.LG 79%

Purrception: Variational Flow Matching for Vector-Quantized Image Generation

Purrception:基于向量量化图像生成的变分流匹配

Răzvan-Andrei Matişan, Vincent Tao Hu, Grigory Bartosh, Björn Ommer, Cees G. M. Snoek, Max Welling, Jan-Willem van de Meent, Mohammad Mahdi Derakhshani, Floor Eijkelboom

专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV

AI总结 Purrception结合连续方法的几何意识与离散监督的分类监督,通过学习代码本索引的类别后验和连续嵌入空间中的速度场,实现对潜在代码的不确定性量化和温度控制生成。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14811 2026-03-17 cs.CV cs.AI 79%

SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models

SegQuant: 一种语义感知且通用的扩散模型量化框架

Jiaji Zhang, Ruichao Sun, Hailiang Zhao, Jiaju Wu, Peng Chen, Hao Li, Yuying Liu, Kingsum Chow, Gang Xiong, Shuiguang Deng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SegQuant提出一种统一的量化框架,通过自适应结合互补技术提升跨模型通用性,采用结构感知图量化策略和双尺度量化方案,有效保持视觉保真度,适用于Transformer扩散模型及其他模型。

Comments 22 pages, 15 figures, to be published in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026), code is available at https://github.com/OptiSys-ZJU/segquant

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04446 2026-03-17 cs.CV 79%

DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models

DiCoDe:扩散压缩深度标记用于语言模型的自回归视频生成

Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Ping Luo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiCoDe利用扩散压缩深度标记,通过自回归语言模型生成视频,实现高效压缩与高质量输出,展示了在视频建模中的潜力。

Comments Project Page: https://liyz15.github.io/DiCoDe

详情

展开后加载摘要…

URL PDF HTML 收藏