arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2411.12831 2024-11-21 cs.CV 85%

Towards motion from video diffusion models

Paul Janson, Tiberiu Popa, Eugene Belilovsky

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted at ECCV 2024 Workshop :Foundation Models for 3D Humans

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03150 2024-11-19 cs.CV cs.LG 85%

Video Diffusion Models: A Survey

Andrew Melnik, Michal Ljubljanac, Cong Lu, Qi Yan, Weiming Ren, Helge Ritter

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments https://github.com/ndrwmlnk/Awesome-Video-Diffusion-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03160 2024-10-07 cs.CV cs.LG 85%

Redefining Temporal Modeling in Video Diffusion: The Vectorized Timestep Approach

Yaofang Liu, Yumeng Ren, Xiaodong Cun, Aitor Artola, Yang Liu, Tieyong Zeng, Raymond H. Chan, Jean-michel Morel

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments Code at https://github.com/Yaofang-Liu/FVDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10647 2024-09-17 cs.CV cs.AI cs.LG 85%

A Survey on Video Diffusion Models

Zhen Xing, Qijun Feng, Haoran Chen, Qi Dai, Han Hu, Hang Xu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07537 2024-07-26 cs.CV 85%

FreeInit: Bridging Initialization Gap in Video Diffusion Models

Tianxing Wu, Chenyang Si, Yuming Jiang, Ziqi Huang, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://tianxingwu.github.io/pages/FreeInit/ Code: https://github.com/TianxingWu/FreeInit

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10981 2024-06-18 cs.CV 85%

ViD-GPT: Introducing GPT-style Autoregressive Generation in Video Diffusion Models

Kaifeng Gao, Jiaxin Shi, Hanwang Zhang, Chunping Wang, Jun Xiao

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments Code will be available at https://github.com/Dawn-LX/Causal-VideoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02813 2024-04-10 cs.CV cs.AI 85%

BIVDiff: A Training-Free Framework for General-Purpose Video Synthesis via Bridging Image and Video Diffusion Models

Fengyuan Shi, Jiaxi Gu, Hang Xu, Songcen Xu, Wei Zhang, Limin Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2024. Project page: https://bivdiff.github.io; GitHub repository: https://github.com/MCG-NJU/BIVDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13729 2024-04-05 cs.CV 85%

Hybrid Video Diffusion Models with 2D Triplane and 3D Wavelet Representation

Kihong Kim, Haneol Lee, Jihye Park, Seyeon Kim, Kwanghee Lee, Seungryong Kim, Jaejun Yoo

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments Project page is available at https://hxngiee.github.io/HVDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10474 2024-03-27 cs.CV cs.GR cs.LG 85%

Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models

Songwei Ge, Seungjun Nah, Guilin Liu, Tyler Poon, Andrew Tao, Bryan Catanzaro, David Jacobs, Jia-Bin Huang, Ming-Yu Liu, Yogesh Balaji

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ICCV 2023. Project webpage: https://research.nvidia.com/labs/dir/pyoco

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15169 2024-01-31 cs.CV 85%

FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling

Haonan Qiu, Menghan Xia, Yong Zhang, Yingqing He, Xintao Wang, Ying Shan, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments ICLR 2024, Project Page: http://haonanqiu.com/projects/FreeNoise.html, Code Repo: https://github.com/AILab-CVC/FreeNoise

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06662 2023-12-12 cs.CV cs.AI cs.LG 85%

Photorealistic Video Generation with Diffusion Models

Agrim Gupta, Lijun Yu, Kihyuk Sohn, Xiuye Gu, Meera Hahn, Li Fei-Fei, Irfan Essa, Lu Jiang, José Lezama

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project website https://walt-video-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03793 2023-12-08 cs.CV 85%

AnimateZero: Video Diffusion Models are Zero-Shot Image Animators

Jiwen Yu, Xiaodong Cun, Chenyang Qi, Yong Zhang, Xintao Wang, Ying Shan, Jian Zhang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://vvictoryuki.github.io/animatezero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15127 2023-11-28 cs.CV 85%

Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets

Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorenz, Yam Levi, Zion English, Vikram Voleti, Adam Letts, Varun Jampani, Robin Rombach

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15103 2023-09-28 cs.CV 85%

LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models

Yaohui Wang, Xinyuan Chen, Xin Ma, Shangchen Zhou, Ziqi Huang, Yi Wang, Ceyuan Yang, Yinan He, Jiashuo Yu, Peiqing Yang, Yuwei Guo, Tianxing Wu, Chenyang Si, Yuming Jiang, Cunjian Chen, Chen Change Loy, Bo Dai, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频扩散模型 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Project webpage: https://vchitect.github.io/LaVie-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11018 2023-05-12 cs.CV 85%

MagicVideo: Efficient Video Generation With Latent Diffusion Models

Daquan Zhou, Weimin Wang, Hanshu Yan, Weiwei Lv, Yizhe Zhu, Jiashi Feng

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV 84%

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08703 2026-03-10 cs.CV 84%

HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising

HiAR:通过分层去噪实现高效的自回归长视频生成

Kai Zou, Dian Zheng, Hongbo Liu, Tiankai Hang, Bin Liu, Nenghai Yu

专题命中 视频扩散模型 :video generation(title);long video(title);分类 cs.CV

AI总结 HiAR通过分层去噪框架在保持时间连续性的同时减少误差传播,实现高效长视频生成。

Comments Project page: https://jacky-hate.github.io/HiAR/ Code: https://github.com/Jacky-hate/HiAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06533 2026-03-09 cs.CV 84%

NEGATE: Constrained Semantic Guidance for Linguistic Negation in Text-to-Video Diffusion

NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学 College Park 分校)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。

Comments 50 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07149 2025-08-12 cs.CV 84%

SketchAnimator: Animate Sketch via Motion Customization of Text-to-Video Diffusion Models

Ruolin Yang, Da Li, Honggang Zhang, Yi-Zhe Song

机构 * PRIS, School of Artificial Intelligence, Beijing University of Posts(PRIS人工智能学院,北京邮电大学) SketchX, CVSSP, University of Surrey(SketchX,计算机视觉与模式识别研究所,萨里大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV

Comments 2024 IEEE International Conference on Visual Communications and Image Processing (VCIP); Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14732 2026-06-16 cs.CV cs.AI cs.LG cs.MM 新提交 84%

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion

Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡

Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong, Unsang Park

机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) Department of Artificial Intelligence, Sogang University(西江大学人工智能系)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。

Comments Project page: https://minar09.github.io/steadyforcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02000 2026-06-02 cs.CV cs.AI eess.IV 84%

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学) INSAIT

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV

AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。

Comments Project page: https://jingyunliang.github.io/MeshToken/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20936 2026-04-24 cs.MM cs.CV cs.HC 84%

AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe

AttentionBender: 在视频扩散变换器中操纵交叉注意力作为创造性探测工具

Adam Cole, Mick Grierson

机构 * University of the Arts London(伦敦艺术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

AI总结 AttentionBender通过操纵视频扩散变换器中的交叉注意力,帮助艺术家探索黑箱视频生成的内部机制,揭示交叉注意力的高度交织特性,并产生新的美学效果。

Comments To appear in the Proceedings of the 2026 ACM Creativity and Cognition (C&C '26). 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22175 2025-12-30 cs.CV cs.AI eess.IV 84%

Characterizing Motion Encoding in Video Diffusion Timesteps

视频扩散时间步中的运动编码表征

Vatsal Baherwani, Yixuan Ren, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV

AI总结 本文通过分析视频扩散模型中时间步的运动与外观编码特性,发现早期时间步主导运动,后期主导外观,并提出受限于运动主导阶段的运动定制方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10567 2025-10-02 cs.CV eess.IV 84%

H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models

Yushu Wu, Yanyu Li, Ivan Skorokhodov, Anil Kag, Willi Menapace, Sharath Girish, Aliaksandr Siarohin, Yanzhi Wang, Sergey Tulyakov

机构 * Snap Inc. Northeastern University(东北大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14018 2025-06-24 cs.CV cs.AI cs.MM cs.RO 84%

SurgSora: Object-Aware Diffusion Model for Controllable Surgical Video Generation

Tong Chen, Shuya Yang, Junyi Wang, Long Bai, Hongliang Ren, Luping Zhou

机构 * The University of Sydney, Sydney, Australia(悉尼大学) The University of Hong Kong, Hong Kong SAR, China(香港大学) The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23085 2025-05-30 cs.CV cs.AI eess.IV 84%

GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion

Gwanghyun Kim, Xueting Li, Ye Yuan, Koki Nagano, Tianye Li, Jan Kautz, Se Young Chun, Umar Iqbal

机构 * NVIDIA Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV

Comments Project page: https://research.nvidia.com/labs/dair/geoman

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14325 2025-03-19 cs.CV eess.IV 84%

LeanVAE: An Ultra-Efficient Reconstruction VAE for Video Diffusion Models

Yu Cheng, Fajie Yuan

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07452 2024-09-12 cs.CV cs.MM 84%

Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models

Haibo Yang, Yang Chen, Yingwei Pan, Ting Yao, Zhineng Chen, Chong-Wah Ngo, Tao Mei

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

Comments ACM Multimedia 2024. Source code is available at \url{https://github.com/yanghb22-fdu/Hi3D-Official}

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01199 2024-09-10 cs.CV eess.IV 84%

OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model

Liuhan Chen, Zongjian Li, Bin Lin, Bin Zhu, Qian Wang, Shenghai Yuan, Xing Zhou, Xinhua Cheng, Li Yuan

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV

Comments https://github.com/PKU-YuanGroup/Open-Sora-Plan

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17808 2024-03-27 eess.IV cs.CV cs.LG 84%

Annotated Biomedical Video Generation using Denoising Diffusion Probabilistic Models and Flow Fields

Rüveyda Yilmaz, Dennis Eschweiler, Johannes Stegmaier

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏