arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2601.05722 2026-01-12 cs.CV 83%

Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation

旋转你的角色:重新审视视频扩散模型用于高质量3D角色生成

Jin Wang, Jianxiang Lu, Comi Chen, Guangzheng Xu, Haoyu Yang, Peng Chen, Na Zhang, Yifan Xu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * Hunyuan, Tencent(腾讯文予实验室) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出RCM模型,通过旋转角色姿势实现高质量3D角色生成和新视角合成,支持多视角输入和高分辨率视频生成。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21855 2026-01-12 cs.CV 83%

ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling

ReVision: 通过显式3D运动建模改进视频扩散

Qihao Liu, Ju He, Qihang Yu, Liang-Chieh Chen, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ReVision通过整合参数化的3D运动模型,提升视频生成中复杂动作和交互的真实性和可控性。

Comments TMLR camera-ready version. Project Page: https://revision-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04342 2026-01-09 cs.CV 83%

ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

ReHyAt:用于视频扩散变换器的递归混合注意力

Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ReHyAt通过结合softmax和线性注意力,实现高效的视频扩散模型,降低训练成本并提升长序列生成的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24227 2026-01-01 cs.CV 83%

Mirage: One-Step Video Diffusion for Photorealistic and Coherent Asset Editing in Driving Scenes

Mirage: 驾驶场景中光实且一致的资产编辑一步视频扩散

Shuyun Wang, Haiyang Sun, Bing Wang, Hangjun Ye, Xin Yu

机构 * The University of Queensland(昆士兰大学) Xiaomi EV(小米电动车)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Mirage提出了一种用于驾驶场景中光实且一致的资产编辑的一步视频扩散模型,通过引入时序无关的潜在特征和两阶段数据对齐策略,提升了视觉保真度和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV 83%

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21019 2025-12-29 cs.CV 83%

Phased One-Step Adversarial Equilibrium for Video Diffusion Models

相位单步对抗均衡用于视频扩散模型

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Hongyi Henry Jin, Kai Yu, Peng Zhang, Wenyue Li, Yuan Zhou, Tianxiang Zheng, Qinglin Lu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 V-PAE通过相位单步对抗均衡方法提升大规模视频模型的生成质量与效率,实现高质量视频生成并显著降低扩散延迟。

Comments Accepted by AAAI 2026. Project Page: https://v-pae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21268 2025-12-25 cs.CV 83%

ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision

ACD: 通过注意力监督实现视频扩散模型的直接条件控制

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Yonsei University(延世大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV 83%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17253 2025-12-22 cs.CV 83%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG 83%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05754 2025-12-08 cs.CV 83%

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV 83%

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 83%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16864 2025-11-25 cs.CV 83%

Training-Free Efficient Video Generation via Dynamic Token Carving

无需训练的高效视频生成 via 动态令牌雕刻

Yuechen Zhang, Jinbo Xing, Bin Xia, Shaoteng Liu, Bohao Peng, Xin Tao, Pengfei Wan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Jenga通过动态注意力雕刻和逐步分辨率生成,实现无需训练的高效视频生成,显著提升生成速度并保持生成质量。

Comments NeurIPS 2025, Project Page: https://julianjuaner.github.io/projects/jenga/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24899 2025-11-18 cs.CV 83%

Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

Mohsen Ghafoorian, Denis Korzhenkov, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00652 2025-11-18 cs.CV cs.CR 83%

Video Signature: Implicit Watermarking for Video Diffusion Models

Yu Huang, Junhao Chen, Shuliang Liu, Hanqian Li, Jungang Li, Qi Zheng, Aiwei Liu, Yi R. Fung, Xuming Hu

机构 * AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能 thrust) Hong Kong University of Science and Technology(香港科学与技术大学) School of Software, BNRist, Tsinghua University(清华大学软件学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08009 2025-11-11 cs.CV cs.AI cs.LG 83%

Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion

Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, Eli Shechtman

机构 * Adobe Research(Adobe研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments NeurIPS 2025 spotlight. Project website: http://self-forcing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10501 2025-10-31 cs.CV cs.LG 83%

OnlyFlow: Optical Flow based Motion Conditioning for Video Diffusion Models

Mathis Koroglu, Hugo Caselles-Dupré, Guillaume Jeanneret Sanmiguel, Matthieu Cord

机构 * Obvious Research ISIR - Sorbonne University(ISIR - 索邦大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 8 pages, 1 supplementary page, 9 figures

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2025, pp. 6225-6235

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19022 2025-10-23 cs.CV 83%

MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models

Aritra Bhowmik, Denis Korzhenkov, Cees G. M. Snoek, Amirhossein Habibian, Mohsen Ghafoorian

机构 * University of Amsterdam(阿姆斯特丹大学) Qualcomm AI Research(高通AI研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04126 2025-10-20 cs.CV cs.AI 83%

Multi-identity Human Image Animation with Structural Video Diffusion

Zhenzhi Wang, Yixuan Li, Yanhong Zeng, Yuwei Guo, Dahua Lin, Tianfan Xue, Bo Dai

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments ICCV 2025 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14179 2025-10-17 cs.CV cs.AI 83%

Virtually Being: Customizing Camera-Controllable Video Diffusion Models with Multi-View Performance Captures

Yuancheng Xu, Wenqi Xian, Li Ma, Julien Philip, Ahmet Levent Taşel, Yiwei Zhao, Ryan Burgert, Mingming He, Oliver Hermann, Oliver Pilarski, Rahul Garg, Paul Debevec, Ning Yu

机构 * Eyeline Labs(Eyeline实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07944 2025-10-17 cs.CV 83%

CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving

Tianrui Zhang, Yichen Liu, Zilin Guo, Yuxin Guo, Jingcheng Ni, Chenjing Ding, Dan Xu, Lewei Lu, Zehuan Wu

机构 * Sensetime Research(商汤科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09789 2025-10-17 cs.CV cs.AI 83%

On Equivariance and Fast Sampling in Video Diffusion Models Trained with Warped Noise

Chao Liu, Arash Vahdat

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12626 2025-10-16 cs.CV 83%

Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models

Lvmin Zhang, Shengqu Cai, Muyang Li, Gordon Wetzstein, Maneesh Agrawala

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments https://github.com/lllyasviel/FramePack

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12785 2025-10-15 cs.CV cs.AI cs.GR 83%

MVP4D: Multi-View Portrait Video Diffusion for Animatable 4D Avatars

Felix Taubner, Ruihang Zhang, Mathieu Tuli, Sherwin Bahmani, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Vector Institute Canada(加拿大向量研究所) University of Toronto Canada(多伦多大学加拿大)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10670 2025-10-14 cs.CV 83%

AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes

Yu Li, Menghan Xia, Gongye Liu, Jianhong Bai, Xintao Wang, Conglang Zhang, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24695 2025-10-14 cs.CV cs.AI 83%

SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer

Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA HKU(香港大学) MIT(麻省理工学院) THU(清华大学) PKU(北京大学) KAUST(国王 Abdullah 基础研究科学研究院)

专题命中 视频扩散模型 :video generation(title,abstract);long video(abstract);分类 cs.CV

Comments 21 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18809 2025-10-14 cs.CV 83%

VORTA: Efficient Video Diffusion via Routing Sparse Attention

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Shunyu Liu, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. The code is available at https://github.com/wenhao728/VORTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03517 2025-10-13 cs.CV 83%

DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models

Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Research University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2025 Spotlight. Project page: https://snap-research.github.io/DenseDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07345 2025-10-10 q-bio.QM cs.AI eess.IV 83%

Mitigating Surgical Data Imbalance with Dual-Prediction Video Diffusion Model

Danush Kumar Venkatesh, Adam Schmidt, Muhammad Abdullah Jamal, Omid Mohareri

机构 * a Department of Translational Surgical Oncology, NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden,HZDR, Germany(a 转化外科肿瘤学部,NCT/UCC 德累斯顿,DKFZ、医学院和卡尔·古斯塔夫·卡尔斯医院、德累斯顿技术大学、HZDR 的联合体,德国) b Intuitive Surgical, Inc., Sunnyvale, CA, United States(b 直觉手术公司,美国加利福尼亚州 Sunnyvale)

专题命中 视频扩散模型 :video diffusion(title,abstract);video understanding(abstract);分类 eess.IV

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏