arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2604.18168 2026-04-21 cs.CV 83%

Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation

通过判别性文本表示将一类标签的一步图像生成扩展到文本

Chenxi Zhao, Chen Zhu, Xiaokun Feng, Aiming Hao, Jiashu Zhu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Jufeng Yang

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过判别性文本表示将MeanFlow框架从固定类标签扩展到灵活文本输入,提升生成内容的丰富性,并在扩散模型上验证了方法的有效性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05449 2026-04-21 cs.CV cs.AI 83%

DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

DisCa:通过与知识蒸馏兼容的可学习特征缓存加速视频扩散变换器

Chang Zou, Changlin Li, Yang Li, Patrol Li, Jianbing Wu, Xiao He, Songtao Liu, Zhao Zhong, Kailin Huang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Xidian University(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种与知识蒸馏兼容的可学习特征缓存机制,用于加速视频扩散变换器,通过轻量级可学习神经预测器提升高维特征演化过程的准确性,并采用保守的受限均值流方法实现更稳定无损的知识蒸馏,从而将加速边界推至11.8倍同时保持生成质量。

Comments 18 pages, 8 figures; cvpr2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24086 2026-04-21 cs.CV 70%

RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention

RainFusion2.0: 基于时序-空间感知与硬件高效性的块状稀疏注意力

Aiyue Chen, Yaofu Liu, Junjian Huang, Guang Lian, Yiwu Yao, Wangli Lan, Jing Lin, Zhixin Ma, Tingting Zhou

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出RainFusion2.0,通过块状均值代表token预测稀疏掩码、时空感知token排列及首帧sink机制,实现视频和图像生成模型的高效稀疏注意力,实验表明在保持视频质量的同时,达到80%的稀疏度和1.5~1.8倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 57%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02636 2026-04-21 cs.LG cs.CV 57%

Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models

基于流模型的快速似然评估与采样联合蒸馏

Xinyue Ai, Yutong He, Albert Gu, Ruslan Salakhutdinov, J Zico Kolter, Nicholas Matthew Boffi, Max Simchowitz

机构 * Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出F2D2框架,通过联合蒸馏减少流模型采样和似然评估的NFE数量,实现高效计算与高精度似然估计。

Comments Project page: https://kellyyutonghe.github.io/f2d2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18117 2026-04-21 cs.LG 50%

LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

LoRaQ:面向4位量化优化的低秩近似

Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen, Kristof Denolf, Mathieu Salzmann

机构 * Computer Vision Laboratory, Ecole Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机视觉实验室) Research and Advancement Development Team, Advanced Micro Devices, Inc, USA(美国高级微器件公司研发与进步发展团队)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 LoRaQ通过简化校准方法,实现了无需高精度分支的4位量化优化,首次提出全子16位流水线,提升Pixart-$Σ$和SANA模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏