arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-15 至 2026-04-15 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2604.12219 2026-04-15 cs.CV cs.AI 83%

Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation

乘风而行:面向平滑视频生成的精确分配稀疏注意力

Wentai Zhang, Ronghui Xi, Shiyao Peng, Jiayu Huang, Haoran Luo, Zichen Tang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PASA框架,通过动态预算分配、硬件对齐分组近似和随机选择偏置,实现高效且时间平滑的视频生成,减少视觉闪烁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12309 2026-04-15 cs.CV 79%

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12251 2026-04-15 cs.CV 79%

ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models

ArtifactWorld: 通过视频生成模型扩展3D高斯散射体修复

Xinliang Wang, Yifeng Shi, Zhenyu Wu

机构 * Ke Holdings Inc.(凯控股公司) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出ArtifactWorld框架,通过系统数据扩展和双模型范式解决3DGS修复问题,利用视频扩散骨干网络和Artifact-Aware Triplet Fusion机制提升稀疏视图合成和3D重建性能。

Comments The second author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12887 2026-04-15 cs.CV cs.LG 77%

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

VideoFlexTok: 可变长度粗到细视频标记化

Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir

机构 * Apple(苹果公司) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校(EPFL))

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 VideoFlexTok通过可变长度粗到细标记化结构,实现更高效的视频生成,相比传统3D网格标记化,模型更小且生成质量相近。

Comments project page at https://videoflextok.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13036 2026-04-15 cs.CV 57%

Lyra 2.0: Explorable Generative 3D Worlds

Lyra 2.0:可探索的生成3D世界

Tianchang Shen, Sherwin Bahmani, Kai He, Sangeetha Grama Srinivasan, Tianshi Cao, Jiawei Ren, Ruilong Li, Zian Wang, Nicholas Sharp, Zan Gojcic, Sanja Fidler, Jiahui Huang, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lyra 2.0通过维持每帧3D几何和自增强历史训练,解决空间遗忘和时间漂移问题,实现大规模可探索的3D世界生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/lyra2/

详情

展开后加载摘要…

URL PDF HTML 收藏