arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-10 至 2026-03-10 共收录 8 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 8 篇

2603.08258 2026-03-10 cs.CV 83%

WaDi: Weight Direction-aware Distillation for One-step Image Synthesis

WaDi:基于权重方向的扩散模型一步图像合成知识蒸馏

Lei Wang, Yang Cheng, Senmao Li, Ge Wu, Yaxing Wang, Jian Yang

专题命中 效率与蒸馏 :image synthesis(title);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 WaDi通过LoRaD方法实现一步扩散模型蒸馏,以更高效的方式生成图像,同时保持高质量输出。

Comments Accepted to CVPR 2026;Code:https://github.com/gudaochangsheng/WaDi

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23681 2026-03-10 cs.CV 79%

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04016 2026-03-10 cs.CV 79%

S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

S$^2$Q-VDiT: 精确量化视频扩散变换器与显著数据和稀疏令牌蒸馏

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 S$^2$Q-VDiT通过显著数据选择和稀疏令牌蒸馏提升视频扩散变换器的量化性能,实现无损压缩和加速推理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07276 2026-03-10 cs.CV cs.LG stat.ML 70%

Variational Flow Maps: Make Some Noise for One-Step Conditional Generation

变分流映射:为一步条件生成引入噪声

Abbas Mammadov, So Takao, Bohan Chen, Ricardo Baptista, Morteza Mardani, Yee Whye Teh, Julius Berner

机构 * University of Oxford(牛津大学) California Institute of Technology(加州理工学院) University of Toronto(多伦多大学) NVIDIA(英伟达公司)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 变分流映射通过学习初始噪声分布,实现单步条件生成,提升逆问题求解效率和样本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 57%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07476 2026-03-10 cs.CV 57%

EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

EVLF: 早期视觉-语言融合用于生成数据集蒸馏

Wenqi Cai, Yawen Zou, Guang Li, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(东福冈大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EVLF通过早期视觉-语言融合提升生成数据集蒸馏的语义准确性和视觉一致性。

Comments CVPR2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10466 2026-03-10 cs.LG cs.AI cs.CR cs.CV 57%

Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction

通过基于潜在聚类的数据减少实现高效的半监督对抗训练

Somrita Ghosh, Yuelin Xu, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全赫尔姆霍兹中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于潜在聚类的数据减少方法,有效降低半监督对抗训练的数据和计算需求,同时保持鲁棒性优势。

Comments Shorter version of this work accepted by NextGenAISafety Workshop at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏