arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-24 至 2026-04-24 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2604.21221 2026-04-24 cs.CV cs.LG 85%

Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation

稀疏强制:用于实时自回归扩散视频生成的原生可训练稀疏注意力

Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出稀疏强制方法,通过在训练和推理中提升长时程生成质量并降低解码延迟,采用可训练的原生稀疏机制和高效的GPU内核PBSA来加速稀疏注意力和内存更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21362 2026-04-24 cs.CV 83%

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

KD-CVG:一种基于知识的创意视频生成方法

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Zipeng Guo, Chao Gou

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出KD-CVG方法,通过构建广告创意知识库解决文本到视频模型在语义对齐和运动适应性方面的不足,提升创意视频生成效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21291 2026-04-24 cs.CV cs.AI 79%

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07940 2026-04-24 cs.CV 57%

Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos

超越帧限:从视角视频生成360度全景视频

Rundong Luo, Matthew Wallingford, Ali Farhadi, Noah Snavely, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从视角视频生成完整全景视频的方法,通过设计几何与运动感知操作提升生成质量,实现空间与时间一致性,应用于视频稳定、视角控制和交互式视觉问答。

Comments Project page: https://red-fairy.github.io/argus/

详情

展开后加载摘要…

URL PDF HTML 收藏