arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-19 至 2026-03-19 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2603.17375 2026-03-19 cs.CV 79%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 79%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16931 2026-03-19 cs.CV cs.AI 74%

Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation

脚本到幻灯片接地:将脚本句子接地到幻灯片对象以实现自动教学视频生成

Rena Suzuki, Masato Kikuchi, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Script-to-Slide Grounding任务,利用大语言模型实现脚本与幻灯片对象的自动接地,实验显示F1分数达0.924,为自动化幻灯片视频编辑奠定基础。

Comments The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17989 2026-03-19 cs.CV 70%

Versatile Editing of Video Content, Actions, and Dynamics without Training

无需训练的视频内容、动作和动态编辑

Vladimir Kulikov, Roni Paiss, Andrey Voynov, Inbar Mosseri, Tali Dekel, Tomer Michaeli

机构 * Google DeepMind(谷歌DeepMind) Technion -- Israel Institute of Technology(技术ion-以色列理工学院) The Weizmann Institute of Science(魏茨曼科学研究院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出DynaEdit方法,无需训练即可实现复杂的视频编辑,通过预训练文本到视频流模型,解决现有方法在编辑动作和动态事件时的局限性。

Comments Project page at https://dynaedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21818 2026-03-19 cs.CV 57%

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

SkyReels-V4:多模态视频-音频生成、修复和编辑模型

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, Yikun Dou, Zheng Chen, Mingyuan Fan, Tuanhui Li, Mingshan Chang, Hao Zhang, Xiaopeng Sun, Jingtao Xu, Yuqiang Xie, Jiahua Wang, Zhiheng Xu, Weiming Xiong, Yuzhe Jin, Baoxuan Gu, Binjie Mao, Yunjie Yu, Jujie He, Yuhao Feng, Shiwen Tu, Chaojie Wang, Rui Yan, Wei Shen, Jingchen Wu, Peng Zhao, Xuanyue Zhong, Zhuangzhuang Liu, Kaifei Wang, Fuxiang Zhang, Weikai Xu, Wenyan Liu, Binglu Zhang, Yu Shen, Tianhui Xiong, Bin Peng, Liang Zeng, Xuchen Song, Haoxiang Guo, Peiyu Wang, Max W. Y. Lam, Chien-Hung Liu, Yahui Zhou

机构 * Skywork AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 SkyReels-V4是一款多模态视频基础模型,支持视频音频生成、修复和编辑,采用双流多模态扩散变换器架构,结合文本编码器实现多模态指令处理,支持高分辨率、长时长视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏