arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-03 至 2026-04-03 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2603.24270 2026-04-03 cs.CV 79%

ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors

ScrollScape: 通过视频扩散先验解锁32K图像生成

Haodong Yu, Yabo Zhang, Donglin Di, Ruyi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto, Beijing, China(理想汽车(中国北京))

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 ScrollScape通过将超大比例图像生成转化为连续视频生成过程,利用视频模型的时序一致性确保结构完整性,实现32K分辨率的高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV 79%

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01552 2026-04-03 cs.LG 50%

ZEUS: Accelerating Diffusion Models with Only Second-Order Predictor

ZEUS:仅使用二阶预测器加速扩散模型

Yixiao Wang, Ting Jiang, Zishan Shao, Hancheng Ye, Jingwei Sun, Mingyuan Ma, Jianyi Zhang, Yiran Chen, Hai Li

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Computer Science, Duke University(杜克大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。

详情

展开后加载摘要…

URL PDF HTML 收藏