Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers
面向频率的误差有界缓存用于加速扩散变换器
机构 * iFLYTEK
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
面向频率的误差有界缓存用于加速扩散变换器
机构 * iFLYTEK
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。
在一切之后跟踪任何东西:零样本无遮挡视频对象分割
机构 * Department of Computer Science University of York(计算机科学系约克大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 TABE通过单个查询掩码实现零样本无遮挡视频对象分割,利用预训练视频扩散模型进行生成补全,无需重新训练模型即可处理完全遮挡场景。
正交时空分布式转移用于4D生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。
Comments 9 pages, 6 figures, 3 tables, AAAI
NeuralRemaster: 保留相位的扩散用于结构对齐生成
机构 * Toyota Research Institute(丰田研究院) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。