arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 69953 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 69953 篇

2512.13991 2025-12-17 cs.CV 83%

Repurposing 2D Diffusion Models for 3D Shape Completion

将2D扩散模型用于3D形状补全

Yao He, Youngjoong Kwon, Tiange Xiang, Wenxiao Cai, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出利用2D扩散模型进行3D形状补全,通过Shape Atlas实现模态对齐,提升生成效果并验证其在点云补全和网格生成中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11203 2025-12-16 cs.CV 83%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08987 2025-12-16 cs.CV 83%

WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images

WDT-MD:用于视网膜图像微动脉瘤检测的小波扩散变换器

Yifei Sun, Yuzhi He, Junhao Jia, Jinhong Wang, Ruiquan Ge, Changmiao Wang, Hongxia Xu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 WDT-MD 通过小波扩散变换器框架,解决微动脉瘤检测中的身份映射、区分困难和重建效果差问题,提升视网膜图像筛查性能。

Comments 9 pages, 6 figures, 8 tables, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13080 2025-12-16 cs.CV 83%

Counting Hallucinations in Diffusion Models

扩散模型中hallucination的计数

Shuai Fu, Jian Zhou, Qi Chen, Huang Jing, Huy Anh Nguyen, Xiaohan Liu, Zhixiong Zeng, Lin Ma, Quanshi Zhang, Qi Wu

机构 * University of Adelaide(阿德莱德大学) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10041 2025-12-15 cs.CV cs.AI 83%

MetaVoxel: Joint Diffusion Modeling of Imaging and Clinical Metadata

MetaVoxel:联合图像与临床元数据的扩散建模

Yihao Liu, Chenyu Gao, Lianrui Zuo, Michael E. Kim, Brian D. Boyd, Lisa L. Barnes, Walter A. Kukull, Lori L. Beason-Held, Susan M. Resnick, Timothy J. Hohman, Warren D. Taylor, Bennett A. Landman

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MetaVoxel通过联合扩散建模统一图像与临床元数据,实现图像生成、年龄估计和性别预测,性能媲美传统任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13387 2025-12-15 cs.CV cs.AI 83%

Generalized Denoising Diffusion Codebook Models (gDDCM): Tokenizing images using a pre-trained diffusion model

通用去噪扩散代码本模型(gDDCM):利用预训练扩散模型进行图像分词

Fei Kong

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 gDDCM通过统一框架和回溯策略提升图像分词效率,实现对主流扩散模型的兼容性与高质量重建

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02899 2025-12-12 cs.CV 83%

Glance: Accelerating Diffusion Models with 1 Sample

Glance: 通过1个样本加速扩散模型

Zhuobai Dong, Rui Zhao, Songjie Wu, Junchao Yi, Linjie Li, Zhengyuan Yang, Lijuan Wang, Alex Jinpeng Wang

机构 * WHU(武汉大学) NUS(国立新加坡大学) CSU(中国科学技术大学) UESTC(电子科技大学) Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出通过轻量LoRA适配器实现扩散模型的高效加速,仅需1个样本训练即可获得强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10177 2025-12-12 cs.LG cond-mat.stat-mech cs.CV stat.ML 83%

Geometric Regularity in Deterministic Sampling Dynamics of Diffusion-based Generative Models

扩散生成模型确定性采样动态中的几何正则性

Defang Chen, Zhenyu Zhou, Can Wang, Siwei Lyu

机构 * University at Buffalo, State University of New York(纽约州立大学布法罗分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文揭示了扩散生成模型采样轨迹的几何正则性,提出动态规划方案提升图像生成性能。

Comments 57 pages. Accepted by Journal of Statistical Mechanics: Theory and Experiment (2025). The short version was published in ICML 2024. arXiv admin note: text overlap with arXiv:2405.11326

Journal ref J. Stat. Mech. (2025) 124002

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17230 2025-12-12 cs.CV 83%

ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion

ObjectAdd:通过一种无需训练的扩散修改方法将对象添加到图像中

Ziyue Zhang, Mingbao Lin, Quanjian Song, Yuxin Zhang, Rongrong Ji

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 ObjectAdd通过无需训练的扩散修改方法,实现用户指定区域内的对象添加,保持图像一致性与无缝融合。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09247 2025-12-11 cs.CV 83%

OmniPSD: Layered PSD Generation with Diffusion Transformer

OmniPSD:基于扩散变换器的分层PSD生成

Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Lovart AI

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 OmniPSD通过扩散变换器实现文本到PSD生成和图像到PSD分解,提升分层设计的生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02483 2025-12-09 cs.CV 83%

Event-Customized Image Generation

事件定制图像生成

Zhen Wang, Yilei Jiang, Dong Zheng, Jun Xiao, Long Chen

机构 * Zhejiang University, Hangzhou, China(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FreeEvent方法,通过引入实体切换和事件转移路径,实现事件定制化图像生成,提升复杂场景下的定制化能力。

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06353 2025-12-09 cs.CV 83%

TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search

TreeQ: 通过树结构混合精度搜索推动扩散变换器的量化边界

Kaicheng Yang, Kaisen Yang, Baiting Wu, Xun Zhang, Qianrui Yang, Haotong Qin, He Zhang, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 TreeQ通过树结构混合精度搜索方法,首次在DiT模型上实现接近无损的4位PTQ性能,解决了DiT量化中的关键挑战。

Comments Code and Supplementary Material could be found at https://github.com/racoonykc/TreeQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01498 2025-12-08 cs.CV cs.AI 83%

AortaDiff: A Unified Multitask Diffusion Framework For Contrast-Free AAA Imaging

AortaDiff:一种用于无对比剂AAA成像的统一多任务扩散框架

Yuxuan Ou, Ning Bi, Jiazhen Pan, Jiancheng Yang, Boliang Yu, Usama Zidan, Regent Lee, Vicente Grau

机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) Nuffield Department of Surgical Sciences, University of Oxford, United Kingdom(牛津大学外科科学努尔菲尔德系) Technical University of Munich, Germany(慕尼黑技术大学) ELLIS Institute Finland, Finland(芬兰ELLIS研究所) Aalto University, Finland(阿alto大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 AortaDiff通过统一多任务扩散框架实现无对比剂AAA成像,同时生成合成CECT图像并分割主动脉腔和血栓,提升了分割精度和临床测量准确性。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11056 2025-12-04 cs.CV 83%

Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image Tokenization

流到模式:用于最新图像标记化的模式寻求扩散自编码器

Kyle Sargent, Kyle Hsu, Justin Johnson, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FlowMo是一种基于Transformer的扩散自编码器,通过模式匹配和模式寻求阶段实现图像标记化的新SOTA,无需卷积、对抗损失等。

Comments ICCV 2025, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06424 2025-12-04 cs.CV 83%

Margin-aware Preference Optimization for Aligning Diffusion Models without Reference

基于边界的偏好优化:无需参考的扩散模型对齐

Jiwoo Hong, Sayak Paul, Noah Lee, Kashif Rasul, James Thorne, Jongheon Jeong

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出MaPO,一种无需参考的扩散模型对齐方法,通过优化偏好输出与非偏好输出之间的边界,提升T2I任务的适应性能,减少训练时间并优于现有方法。

Comments Accepted to AAAI 2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17636 2025-12-03 cs.CV cs.AI 83%

Aligning Diffusion Models with Noise-Conditioned Perception

对扩散模型进行噪声条件感知对齐

Alexander Gambashidze, Anton Kulikov, Yuriy Sosnin, Ilya Makarov

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute(AIRI)) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯高等经济学院) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究中心,信息与通信技术研究院) ISP RAS(信息与通信技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出在扩散模型的U-Net嵌入空间中使用感知目标,以提升人类偏好对齐的效率和质量,并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01426 2025-12-02 cs.CV 83%

ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers

ResDiT: 在扩散变换器中激发内在分辨率可扩展性

Yiyang Ma, Feng Zhou, Xuedan Yin, Pu Cao, Yonghao Dang, Jianqin Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 ResDiT通过改进位置嵌入和局部增强机制,实现了无需训练的高分辨率图像生成,有效解决空间布局崩溃和纹理保真度下降问题。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 83%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13625 2025-12-02 cs.CV cs.CR 83%

DiffProtect: Generate Adversarial Examples with Diffusion Models for Facial Privacy Protection

DiffProtect: 用扩散模型生成对抗示例以保护面部隐私

Jiang Liu, Chun Pong Lau, Zhongliang Guo, Yuxiang Guo, Zhaoyang Wang, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) City University of Hong Kong(香港城市大学) University of St Andrews(圣安德鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DiffProtect利用扩散模型生成高质量对抗示例,提升面部隐私保护的视觉质量和攻击成功率

Comments Code is at https://github.com/joellliu/DiffProtect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00369 2025-12-02 cs.CV 83%

POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models

POLARIS:用于扩散模型中鲁棒和自适应逆向的投影正交最小二乘法

Wenshuo Chen, Haosen Li, Shaofeng Liang, Lei Wang, Haozhe Jia, Kaishen Yuan, Jieming Wu, Bowen Tian, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Griffith University(格里菲斯大学) Data61/CSIRO Project(Data61/CSIRO项目)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 POLARIS通过将逆向问题转化为误差来源问题,以单行代码提升扩散模型逆向的鲁棒性和适应性,显著减少噪声近似误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00084 2025-12-02 cs.CV cs.LG 83%

A Fast and Efficient Modern BERT based Text-Conditioned Diffusion Model for Medical Image Segmentation

一种快速且高效的基于现代BERT的文本条件扩散模型用于医学图像分割

Venkata Siddharth Dhara, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, 500032, India(国际信息科技学院,海得拉巴)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出FastTextDiff,利用ModernBERT提升医学图像分割的效率和准确性,通过整合文本注释和多模态注意力机制改进传统扩散模型。

Comments 15 pages, 3 figures, Accepted in Slide 3 10th International Conference on Computer Vision & Image Processing (CVIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 83%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19990 2025-11-26 cs.CV 83%

OmniRefiner: Reinforcement-Guided Local Diffusion Refinement

OmniRefiner: 基于强化学习的局部扩散细化

Yaoli Liu, Ziheng Ouyang, Shengtao Lou, Yiren Song

机构 * Zhejiang University(浙江大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 OmniRefiner通过强化学习和局部扩散细化技术,提升参考引导图像生成中细粒度细节的保留与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19936 2025-11-26 cs.CV 83%

Image Diffusion Models Exhibit Emergent Temporal Propagation in Videos

图像扩散模型在视频中表现出涌现的时间传播

Youngseo Kim, Dohyun Kim, Geonhee Han, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(计算机科学与工程系,韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DRIFT框架,利用预训练图像扩散模型和SAM引导的掩码细化,实现视频中鲁棒的零样本物体跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19910 2025-11-26 eess.IV cs.CV 83%

DLADiff: A Dual-Layer Defense Framework against Fine-Tuning and Zero-Shot Customization of Diffusion Models

DLADiff: 一种双层防御框架,用于对抗扩散模型的微调和零样本定制

Jun Jia, Hongyi Miao, Yingjie Zhou, Linhan Cao, Yanwei Jiang, Wangqiu Zhou, Dandan Zhu, Hua Yang, Wei Sun, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DLADiff提出一种双层防御框架,通过双代理模型和交替动态微调有效防御扩散模型的微调和零样本生成攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19385 2025-11-26 cs.CV cs.AI 83%

Advancing Limited-Angle CT Reconstruction Through Diffusion-Based Sinogram Completion

通过扩散基于的sinogram补全推进有限角度CT重建

Jiaqi Guo, Santiago Lopez-Tapia, Aggelos K. Katsaggelos

机构 * Dept. of Electrical and Computer Engineering, Northwestern University, Evanston, IL, USA(电气与计算机工程系,西北大学,爱荷华州埃文斯顿)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的sinogram补全方法,结合蒸馏和伪逆约束,实现高效准确的有限角度CT重建,有效抑制伪影并保持结构细节。

Comments Accepted at the 2025 IEEE International Conference on Image Processing (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19434 2025-11-25 cs.CV cs.LG stat.ML 83%

Breaking the Likelihood-Quality Trade-off in Diffusion Models by Merging Pretrained Experts

通过合并预训练专家打破扩散模型中似然-质量权衡

Yasin Esfandiari, Stefan Bauer, Sebastian U. Stich, Andrea Dittadi

机构 * Saarland University(萨尔兰大学) Helmholtz AI(亥姆霍兹人工智能研究所) Technical University of Munich(慕尼黑技术大学) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全部分研究所) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 通过在去噪过程中切换预训练专家,该方法有效打破扩散模型中似然与质量的权衡,提升图像生成质量和似然

Comments ICLR 2025 DeLTa workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01421 2025-11-25 cs.CV 83%

InfoScale: Unleashing Training-free Variable-scaled Image Generation via Effective Utilization of Information

InfoScale: 通过有效利用信息实现免训练可变尺度图像生成

Guohui Zhang, Jiangtong Tan, Linjiang Huang, Zhonghang Yuan, Mingde Yao, Jie Huang, Feng Zhao

机构 * USTC(中国科学技术大学) Beihang University(北京航空航天大学) CUHK MMLab(香港中文大学多媒体实验室) Kuaishou Technology(快手科技)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 InfoScale通过有效利用信息解决扩散模型在可变尺度图像生成中的信息丢失、聚合不灵活和分布不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16904 2025-11-24 cs.CV 83%

Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models

Warm Diffusion: Blur-Noise Mixture Diffusion Models的配方

Hao-Chien Hsueh, Chi-En Yen, Wen-Hsiao Peng, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,Hsinchu,台湾)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Warm Diffusion通过融合模糊与噪声的混合模型,解决传统热扩散和冷扩散的不足,提升图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10629 2025-11-24 cs.CV 83%

One Small Step in Latent, One Giant Leap for Pixels: Fast Latent Upscale Adapter for Your Diffusion Models

潜在空间中的一小步,像素世界中的一大跃:一种快速的潜在上采样适配器用于您的扩散模型

Aleksandr Razin, Danil Kazantsev, Ilya Makarov

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种轻量级潜在上采样适配器,通过潜在空间单次前向传递实现高分辨率图像合成,提升效率并保持保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏