arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-28 至 2026-04-28 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2604.22808 2026-04-28 cs.CV cs.AI eess.IV 81%

FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers

FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器

Haopeng Jin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。

Comments 24 pages, 17 figures, 14 tables, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23858 2026-04-28 cs.CV 57%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏