arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-24 至 2026-06-24 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 3 篇

2606.18478 2026-06-24 cs.CV 新提交 57%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11121 2026-06-24 cs.CV eess.IV 版本更新 57%

Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior

生成式流形蒸馏:将恢复轨迹与自然图像先验对齐

Yuyang Hu, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio

机构 * Google(谷歌) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出生成式流形蒸馏(GMD),通过几何流形对齐实现无配对域自适应,利用冻结文本到图像基础模型的流匹配动力学将离流形恢复投影到自然图像流形,并引入质量门控滤波器和源锚定轨迹正则化,无需架构修改或推理延迟即可提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24745 2026-06-24 cs.SD cs.AI eess.AS 新提交 50%

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

超越U-Net:用于流匹配语音增强的无跳跃连接潜在表示对齐骨干网络

Wangyi Pu, Michele Scarpiniti

机构 * Department of Information Engineering, Electronics and Telecommunications(信息工程、电子与电信系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种无跳跃连接的编码器-解码器骨干网络,通过潜在表示对齐(LRA)引导流匹配语音增强,避免U-Net跳跃连接传递噪声相关特征,仅需五次函数评估即可提升PESQ和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏