arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2536 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2536 篇

2602.12640 2026-02-16 cs.CV 92%

ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models

ImageRAGTurbo: 向一步文本到图像生成迈进的检索增强扩散模型

Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, René Vidal, Amit Kumar K C, Vamsi Salaka, Rahul Bhagat

机构 * Amazon Core Search(亚马逊核心搜索)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ImageRAGTurbo通过检索增强扩散模型实现高效一步文本到图像生成,提升图像质量并减少延迟。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17086 2024-07-25 cs.CV cs.CL 92%

PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation

Jian Ma, Chen Chen, Qingsong Xie, Haonan Lu

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18158 2023-12-01 cs.CV 91%

HiPA: Enabling One-Step Text-to-Image Diffusion Models via High-Frequency-Promoting Adaptation

Yifan Zhang, Bryan Hooi

专题命中 效率与蒸馏 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14753 2026-06-10 cs.CV cs.LG 版本更新 89%

Cost-Aware Routing for Efficient Text-To-Image Generation

面向文本到图像生成的高效路由:成本感知方法

Qinchan Li, Kenneth Chen, Changyue Su, Wittawat Jitkrittum, Qi Sun, Patsorn Sangkloy

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院) Google(谷歌) Eigen 4D Inc.(Eigen 4D公司)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出成本感知路由框架,根据提示复杂度自动选择不同去噪步数或模型,在保证高质量的同时降低计算成本,优于单一模型。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23463 2026-03-25 cs.CV cs.AI 89%

InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting

InverFill:一种用于增强少步扩散修复的一步倒置方法

Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran

机构 * Qualcomm AI Research(.qualcomm 高级研究院) Posts & Telecommunications Inst. of Tech., Vietnam(越南邮电技术研究所)

专题命中 效率与蒸馏 :diffusion(title,abstract);inpainting(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出InverFill,通过注入输入遮挡图像的语义信息到初始噪声中,实现高质量少步修复。该方法无需训练修复模型,利用文本到图像模型进行混合采样,提升图像质量和文本一致性。

Comments Accepted to CVPR'26 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06879 2026-02-09 cs.CV cs.AI 89%

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX:基于知识蒸馏的大型文本到图像生成模型压缩方法用于移动设备

Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 NanoFLUX通过知识蒸馏和渐进压缩技术,将大型文本到图像生成模型压缩至2.4B,实现移动设备上的高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22374 2025-12-30 cs.CV cs.AI cs.LG 89%

Self-Evaluation Unlocks Any-Step Text-to-Image Generation

自我评估解锁任意步文本到图像生成

Xin Yu, Xiaojuan Qi, Zhengqi Li, Kai Zhang, Richard Zhang, Zhe Lin, Eli Shechtman, Tianyu Wang, Yotam Nitzan

机构 * The University of Hong Kong(香港大学) Adobe Research(Adobe研究)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Self-E 是一种新颖的从头开始训练方法,通过自我评估机制实现任意步文本到图像生成,兼具高效与高质量生成能力。

Comments Project page: https://xinyu-andy.github.io/SelfE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13006 2025-12-16 cs.CV 89%

Few-Step Distillation for Text-to-Image Generation: A Practical Guide

文本到图像生成的少步蒸馏:一份实用指南

Yifan Pu, Yizeng Han, Zhiwei Tang, Jiasheng Tang, Fan Wang, Bohan Zhuang, Gao Huang

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华研实验室) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出了一种少步蒸馏方法,用于文本到图像生成,通过比较先进技术并提供实用指南,以提高生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04301 2025-06-03 cs.CV 89%

SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion

Trong-Tung Nguyen, Quang Nguyen, Khoi Nguyen, Anh Tran, Cuong Pham

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与蒸馏 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00996 2025-04-02 cs.CV 89%

TurboFill: Adapting Few-step Text-to-image Model for Fast Image Inpainting

Liangbin Xie, Daniil Pakhomov, Zhonghao Wang, Zongze Wu, Ziyan Chen, Yuqian Zhou, Haitian Zheng, Zhifei Zhang, Zhe Lin, Jiantao Zhou, Chao Dong

专题命中 效率与蒸馏 :text-to-image(title,abstract);inpainting(title,abstract);diffusion(abstract);分类 cs.CV

Comments Project webpage available at https://liangbinxie.github.io/projects/TurboFill/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01561 2025-02-11 cs.CV cs.AI cs.CL cs.LG stat.ML 89%

Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation

Mingyuan Zhou, Zhendong Wang, Huangjie Zheng, Hai Huang

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments ICLR 2025; fixed typos in Table 1; Code and model checkpoints available at https://github.com/mingyuanzhou/SiD-LSG; More efficient code using AMP is coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18128 2024-09-27 cs.CV 89%

FlowTurbo: Towards Real-time Flow-Based Image Generation with Velocity Refiner

Wenliang Zhao, Minglei Shi, Xumin Yu, Jie Zhou, Jiwen Lu

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09133 2026-07-28 cs.CV cs.AI 版本更新 88%

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18281 2026-03-26 cs.CV cs.AI 88%

Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation

Uni-DAD: 集成扩散模型的蒸馏与适应以实现少步少样本图像生成

Yara Bahram, Mélodie Desbos, Mohammadhadi Shateri, Eric Granger

机构 * LIVIA, ILLS, ETS(LIVIA、ILLs、ETS)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 Uni-DAD通过统一蒸馏与适应流程,提升少样本图像生成质量与多样性,采用双域分布匹配和多头GAN损失,实现单阶段高效生成。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00763 2026-03-03 cs.CV 88%

Analyzing and Improving Fast Sampling of Text-to-Image Diffusion Models

分析和改进文本到图像扩散模型的快速采样

Zhenyu Zhou, Defang Chen, Siwei Lyu, Chun Chen, Can Wang

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Institute for Artificial Intelligence and Data Science(人工智能与数据科学研究院) University at Buffalo(布法罗大学)

专题命中 效率与蒸馏 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TORS调度策略,通过优化采样轨迹的几何变化,提升文本到图像扩散模型在有限采样步数下的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07503 2025-12-09 cs.CV 88%

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02687 2025-09-26 cs.CV 88%

Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts

Viet Nguyen, Anh Nguyen, Trung Dao, Khoi Nguyen, Cuong Pham, Toan Tran, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(title);image synthesis(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07679 2024-12-17 cs.CV 88%

Relational Diffusion Distillation for Efficient Image Generation

Weilun Feng, Chuanguang Yang, Zhulin An, Libo Huang, Boyu Diao, Fei Wang, Yongjun Xu

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Accepted by ACM MM 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05239 2024-11-19 cs.CV 88%

SwiftBrush: One-Step Text-to-Image Diffusion Model with Variational Score Distillation

Thuan Hoang Nguyen, Anh Tran

专题命中 效率与蒸馏 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024; Github: https://github.com/VinAIResearch/SwiftBrush

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13942 2024-05-13 cs.CV 88%

StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models

Mohan Zhou, Yalong Bai, Qing Yang, Tiejun Zhao

专题命中 效率与蒸馏 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09794 2024-01-19 cs.CV 88%

Wavelet-Guided Acceleration of Text Inversion in Diffusion-Based Image Editing

Gwanhyeong Koo, Sunjae Yoon, Chang D. Yoo

专题命中 效率与蒸馏 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

Comments The International Conference on Acoustics, Speech, & Signal Processing (ICASSP) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19064 2026-07-23 cs.CV cs.AI cs.LG cs.MM eess.IV 版本更新 88%

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

机构 * Microsoft Mage Team(微软Mage团队)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18251 2025-06-26 cs.GR cs.AI cs.CV 88%

Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models

Chao Li, Jiawei Fan, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Fixed a prompt typo in Figure 18 of the Appendix. This work is accepted to ICML 2025. The project page: https://github.com/deep-optimization/Morse

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11558 2023-01-30 cs.CV 88%

Accelerating Guided Diffusion Sampling with Splitting Numerical Methods

Suttisak Wizadwongsa, Supasorn Suwajanakorn

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Code now available at https://github.com/sWizad/split-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20427 2025-12-11 cs.CV 87%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01008 2025-05-23 cs.CV cs.AI 87%

Fast Sampling Through The Reuse Of Attention Maps In Diffusion Models

Rosco Hunter, Łukasz Dudziak, Mohamed S. Abdelfattah, Abhinav Mehrotra, Sourav Bhattacharya, Hongkai Wen

机构 * University of Warwick(沃里克大学) Samsung AI Centre Cambridge(三星AI研究中心) Cornell University(康奈尔大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14867 2024-05-27 cs.CV 87%

Improved Distribution Matching Distillation for Fast Image Synthesis

Tianwei Yin, Michaël Gharbi, Taesung Park, Richard Zhang, Eli Shechtman, Fredo Durand, William T. Freeman

专题命中 效率与蒸馏 :image synthesis(title,abstract);image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments Code, model, and dataset are available at https://tianweiy.github.io/dmd2

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00879 2024-04-02 cs.CV 87%

Model-Agnostic Human Preference Inversion in Diffusion Models

Jeeyung Kim, Ze Wang, Qiang Qiu

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08128 2024-02-21 cs.CV 87%

Clockwork Diffusion: Efficient Generation With Model-Step Distillation

Amirhossein Habibian, Amir Ghodrati, Noor Fathima, Guillaume Sautiere, Risheek Garrepalli, Fatih Porikli, Jens Petersen

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05482 2026-05-19 cs.LG stat.ML 87%

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions

Van Khoa Nguyen, Lionel Blondé, Alexandros Kalousis

机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(title,title_cn)

AI总结 本文提出了一种基于Stein扩散引导的训练自由后验校正方法,用于在高密度区域之外进行采样。该方法结合了随机最优控制和Stein变分推断,通过引入新的理论界和运行成本函数,实现了在低密度区域的有效引导。

Comments Revised version accepted to the ICML 2026 main track; prior version accepted to two ICLR 2026 workshops: ReALM-GEN and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏