arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-06 至 2026-03-06 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2603.05315 2026-03-06 cs.CV 57%

Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers

面向频率的误差有界缓存用于加速扩散变换器

Guandong Li

机构 * iFLYTEK

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19210 2026-03-06 cs.CV 57%

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

在一切之后跟踪任何东西:零样本无遮挡视频对象分割

Finlay G. C. Hudson, William A. P. Smith

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 TABE通过单个查询掩码实现零样本无遮挡视频对象分割,利用预训练视频扩散模型进行生成补全,无需重新训练模型即可处理完全遮挡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05081 2026-03-06 cs.CV 57%

Orthogonal Spatial-temporal Distributional Transfer for 4D Generation

正交时空分布式转移用于4D生成

Wei Liu, Shengqiong Wu, Bobo Li, Haoyu Zhao, Hao Fei, Mong-Li Lee, Wynne Hsu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。

Comments 9 pages, 6 figures, 3 tables, AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05106 2026-03-06 cs.CV cs.GR cs.LG cs.RO 57%

NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation

NeuralRemaster: 保留相位的扩散用于结构对齐生成

Yu Zeng, Charles Ochoa, Mingyuan Zhou, Vishal M. Patel, Vitor Guizilini, Rowan McAllister

机构 * Toyota Research Institute(丰田研究院) University of Texas, Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏