arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2601.07396 2026-01-13 cs.CV 79%

Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Efficient Diffusion Transformers

预测主成分,稳定残差:面向高效扩散变换器的子空间感知特征缓存

Guantao Chen, Shikang Zheng, Yuqi Lin, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) South China University of Technology(华南理工大学) Jilin University(吉林大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SVD-Cache方法,通过子空间感知的特征缓存技术提升扩散变换器的推理效率,实现近无损效果并支持多种加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23576 2025-12-30 cs.CV 79%

LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation

LiveTalk: 通过改进的在线策略蒸馏实现实时多模态交互视频扩散

Ethan Chern, Zhulin Hu, Bohao Tang, Jiadi Su, Steffi Chern, Zhijie Deng, Pengfei Liu

机构 * SII SJTU GAIR

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LiveTalk系统,通过改进的在线策略蒸馏实现实时多模态交互视频生成,显著提升效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22802 2025-12-30 cs.LG cs.CV 79%

ReDiF: Reinforced Distillation for Few Step Diffusion

ReDiF: 基于强化学习的少步扩散模型知识蒸馏

Amirhossein Tighkhorshid, Zahra Dehghanian, Gholamali Aminian, Chengchun Shi, Hamid R. Rabiee

机构 * London School of Economics(伦敦经济学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 ReDiF通过强化学习方法实现少步扩散模型的知识蒸馏,以更高效的方式生成高质量样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21019 2025-12-29 cs.CV 79%

Phased One-Step Adversarial Equilibrium for Video Diffusion Models

相位单步对抗均衡用于视频扩散模型

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Hongyi Henry Jin, Kai Yu, Peng Zhang, Wenyue Li, Yuan Zhou, Tianxiang Zheng, Qinglin Lu

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 V-PAE通过相位单步对抗均衡方法提升大规模视频模型的生成质量与效率,实现高质量视频生成并显著降低扩散延迟。

Comments Accepted by AAAI 2026. Project Page: https://v-pae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17202 2025-12-22 cs.CV cs.AI 79%

Fose: Fusion of One-Step Diffusion and End-to-End Network for Pansharpening

Fose:一阶段扩散与端到端网络融合用于全色增强

Kai Liu, Zeli Lin, Weibo Wang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 Fose通过融合一步扩散模型与端到端网络,实现全色增强的高效高精度处理,提升速度7.42倍并优于基线模型。

Comments Code link: https://github.com/Kai-Liu001/Fose

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16093 2025-12-19 cs.CV cs.AI cs.LG 79%

TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

TurboDiffusion:通过100-200倍加速视频扩散模型

Jintao Zhang, Kaiwen Zheng, Kai Jiang, Haoxu Wang, Ion Stoica, Joseph E. Gonzalez, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(盛舒科技) UC Berkeley(加州大学伯克利分校)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 TurboDiffusion通过低比特注意力、步骤蒸馏和W8A8量化等技术,实现视频扩散模型100-200倍加速并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00090 2025-12-12 cs.CV cs.AI 79%

LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation

LeMiCa:基于词典极小极大路径缓存的高效扩散式视频生成

Huanlin Gao, Ping Chen, Fuyuan Shi, Chao Tan, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(数据科学与人工智能研究院,中国联合电信) Unicom Data Intelligence, China Unicom(中国联合电信数据智能中心)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 LeMiCa通过词典极小极大路径优化策略,提升扩散式视频生成的推理速度与生成质量,实现高效且高质量的视频合成。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02931 2025-12-03 cs.CV 79%

DiverseAR: Boosting Diversity in Bitwise Autoregressive Image Generation

DiverseAR: 提升位级自回归图像生成中的多样性

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Chenyang Si

机构 * PRLab, Nanjing University(南京大学PRLab) The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Lovart AI WeChat, Tencent Inc.(腾讯公司)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 DiverseAR通过自适应logits分布缩放和能量基生成路径搜索算法,提升位级自回归图像生成的样本多样性,同时保持视觉质量。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07417 2025-12-02 eess.IV cs.CV 79%

Self-Supervised One-Step Diffusion Refinement for Snapshot Compressive Imaging

自监督单步扩散细化用于快照压缩成像

Shaoguang Huang, Yunzhen Wang, Haijin Zeng, Hongyu Chen, Hongyan Zhang

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自监督单步扩散框架,用于提升快照压缩成像的重建精度与效率,实现高质量图像生成并减少计算时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09213 2025-12-01 cs.LG cs.CV 79%

A Sampling-Based Domain Generalization Study with Diffusion Generative Models

基于扩散生成模型的采样域泛化研究

Ye Zhu, Yu Wu, Duo Xu, Zhiwei Deng, Yan Yan, Olga Russakovsky

机构 * LIX, École Polytechnique, IP Paris, France(巴黎高等理工学院LIX实验室) School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) Canadian Institute for Theoretical Astrophysics (CITA), University of Toronto, Canada(多伦多大学理论天体物理研究所) Google DeepMind, USA(谷歌DeepMind公司) Department of Computer Science, University of Illinois Chicago, USA(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于采样的域泛化方法,利用预训练扩散模型生成未见域图像,通过潜在空间中的非域先验分离实现高质量图像合成。

Comments NeurIPS 2025 Workshop on Frontiers in Probabilistic Inference: Learning meets Sampling. Code can be found at https://github.com/L-YeZhu/DiscoveryDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16687 2025-11-27 cs.CV eess.IV 79%

One-Step Diffusion-Based Image Compression with Semantic Distillation

一步扩散式图像压缩与语义蒸馏

Naifu Xue, Zhaoyang Jia, Jiahao Li, Bin Li, Yuan Zhang, Yan Lu

机构 * Communication University of China(中国通信大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 OneDC通过一步扩散生成和语义蒸馏机制实现高效图像压缩,达到SOTA感知质量,比特率降低39%且解码速度提升20倍。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20549 2025-11-26 cs.CV cs.AI 79%

Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习

Guanjie Chen, Shirui Huang, Kai Liu, Jianchen Zhu, Xiaoye Qu, Peng Chen, Yu Cheng, Yifu Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20251 2025-11-26 cs.CV 79%

PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling

PromptMoG: 通过提示嵌入混合高斯采样增强长提示图像生成的多样性

Bo-Kai Ruan, Teng-Fang Hsiao, Ling Lo, Yi-Lun Wu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与蒸馏 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 PromptMoG通过混合高斯采样提升长提示图像生成的多样性,保持语义一致性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23584 2025-11-21 cs.CV 79%

VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement

VividFace: 高质量和高效的一步扩散用于视频面部增强

Shulian Zhang, Yong Guo, Long Peng, Ziyang Wang, Ye Chen, Wenbo Li, Xiao Zhang, Yulun Zhang, Jian Chen

机构 * South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02686 2025-11-19 cs.CV cs.LG 79%

Learning few-step posterior samplers by unfolding and distillation of diffusion models

Charlesquin Kemajou Mbakam, Jonathan Spence, Marcelo Pereyra

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments 34 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22463 2025-11-19 cs.CV cs.LG 79%

Modulated Diffusion: Accelerating Generative Modeling with Modulated Quantization

Weizhi Gao, Zhichao Hou, Junqi Yin, Feiyi Wang, Linyu Peng, Xiaorui Liu

机构 * Department of Computer Science, North Carolina State University(北卡罗来纳州立大学计算机科学系) National Center for Computational Science, Oak Ridge National Lab(橡树岭国家实验室计算科学中心) Department of Mechanical Engineering, Keio University(庆应大学机械工程系)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments 26 pages, accepted by ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267, 18337-18362, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24899 2025-11-18 cs.CV 79%

Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

Mohsen Ghafoorian, Denis Korzhenkov, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10122 2025-11-18 cs.CV cs.AI 79%

Realism Control One-step Diffusion for Real-World Image Super-Resolution

Zongliang Wu, Siming Zheng, Peng-Tao Jiang, Xin Yuan

机构 * Zongliang Wu 1, 2, 3(吴宗亮) Siming Zheng 3(郑思明) Peng-Tao Jiang 3(江鹏涛) Xin Yuan 2(袁鑫)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments Supplementary materials is included. The paper is accepted by AAAI 2026 (Oral). Code and models: https://zongliang-wu.github.io/RCOD-SR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12181 2025-11-18 cs.CV cs.LG 79%

MixAR: Mixture Autoregressive Image Generation

Jinyuan Hu, Jiayou Zhang, Shaobo Cui, Kun Zhang, Guangyi Chen

机构 * Tsinghua University(清华大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16239 2025-11-07 cs.CV 79%

DOVE: Efficient One-Step Diffusion Model for Real-World Video Super-Resolution

Zheng Chen, Zichen Zou, Kewei Zhang, Xiongfei Su, Xin Yuan, Yong Guo, Yulun Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) China Mobile Research Institute(中国移动研究院) Westlake University(西湖大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025. Code is available at: https://github.com/zhengchen1999/DOVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00110 2025-11-04 cs.CV cs.AI 79%

Chain of Time: In-Context Physical Simulation with Image Generation Models

YingQiao Wang, Eric Bigelow, Boyi Li, Tomer Ullman

机构 * Harvard University(哈佛大学) Sakana AI NTT Research(NTT研究所) UC Berkeley(伯克利大学) Nvidia Research(NVIDIA研究)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19755 2025-11-04 cs.LG cs.AI cs.CV 79%

A Survey on Cache Methods in Diffusion Models: Toward Efficient Multi-Modal Generation

Jiacheng Liu, Xinyu Wang, Yuqi Lin, Zhikai Wang, Peiru Wang, Peiliang Cai, Qinming Zhou, Zhengan Yan, Zexuan Yan, Zhengyi Shi, Chang Zou, Yue Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments 22 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23285 2025-11-03 cs.CV 79%

Adaptive Stochastic Coefficients for Accelerating Diffusion Sampling

Ruoyu Wang, Beier Zhu, Junzhi Li, Liangyu Yuan, Chi Zhang

机构 * AGI Lab, Westlake University(西交大实验室,西湖大学) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Tongji University(同济大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments To appear in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10270 2025-10-28 cs.CV 79%

EEdit: Rethinking the Spatial and Temporal Redundancy for Efficient Image Editing

Zexuan Yan, Yue Ma, Chang Zou, Wenteng Chen, Qifeng Chen, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :image editing(title,abstract);分类 cs.CV

Comments accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20755 2025-10-23 cs.LG cs.CV 79%

Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction

Yifei Wang, Weimin Bai, Colin Zhang, Debing Zhang, Weijian Luo, He Sun

机构 * College of Future Technology(未来技术学院) National Biomedical Imaging Center(国家生物医学成像中心) Academy for Advanced Interdisciplinary Studies(先进跨学科研究学院) hi-lab Yuanpei College(元培学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10103 2025-10-22 cs.CV cs.LG 79%

Improving Diffusion-based Inverse Algorithms under Few-Step Constraint via Learnable Linear Extrapolation

Jiawei Zhang, Ziyuan Liu, Leon Yan, Gen Li, Yuantao Gu

机构 * Tsinghua University(清华大学) CUHK(香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09012 2025-10-21 cs.CV 79%

Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy

Xiaoxiao Ma, Feng Zhao, Pengyang Ling, Haibo Qiu, Zhixiang Wei, Hu Yu, Jie Huang, Zhixiong Zeng, Lin Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

Comments Code is available at https://github.com/krennic999/ARsample

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12231 2025-10-15 cs.CV 79%

BIGFix: Bidirectional Image Generation with Token Fixing

Victor Besnier, David Hurych, Andrei Bursuc, Eduardo Valle

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11962 2025-10-15 cs.LG cs.CV 79%

MosaicDiff: Training-free Structural Pruning for Diffusion Model Acceleration Reflecting Pretraining Dynamics

Bowei Guo, Shengkun Tang, Cong Zeng, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18809 2025-10-14 cs.CV 79%

VORTA: Efficient Video Diffusion via Routing Sparse Attention

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Shunyu Liu, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. The code is available at https://github.com/wenhao728/VORTA

详情

展开后加载摘要…

URL PDF HTML 收藏