arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-04 至 2026-05-04 共收录 2 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2 篇

2605.00329 2026-05-04 cs.SD eess.AS 50%

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

通过能量评分与辅助上下文表示蒸馏实现一步文本到音频生成

Kuan-Po Huang, Bo-Ru Lu, Byeonggeun Kim, Mihee Lee, Zalan Fabian, Renard Korzeniowski, Qingming Tang, Greg Ver Steeg, Hung-yi Lee, Chieh-Chi Kao, Chao Wang

机构 * National Taiwan University(国立台湾大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种结合能量距离训练和表示层蒸馏的一步采样框架,有效提升了文本到音频生成的速度与质量,在AudioCaps基准上优于现有方法,达到与多步采样扩散模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07744 2026-05-04 cs.LG 50%

Riemannian MeanFlow

Riemannian MeanFlow:在流形上直接学习流映射的高效生成框架

Dongyeop Woo, Marta Skreta, Seonghyun Park, Kirill Neklyudov, Sungsoo Ahn

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 Riemannian MeanFlow在流形上直接学习流映射,通过单次前向传递实现高质量生成,相比传统方法减少10倍的函数评估次数,并通过奖励预览实现高效奖励引导设计。

详情

展开后加载摘要…

URL PDF HTML 收藏