arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2403.05438 2024-03-11 cs.CV 83%

VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models

Yabo Zhang, Yuxiang Wei, Xianhui Lin, Zheng Hui, Peiran Ren, Xuansong Xie, Xiangyang Ji, Wangmeng Zuo

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://videoelevator.github.io Code: https://github.com/YBYBZhang/VideoElevator

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09047 2024-01-18 cs.CV 83%

VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models

Haoxin Chen, Yong Zhang, Xiaodong Cun, Menghan Xia, Xintao Wang, Chao Weng, Ying Shan

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Homepage: https://ailab-cvc.github.io/videocrafter; Github: https://github.com/AILab-CVC/VideoCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01409 2023-12-05 cs.CV cs.AI cs.GR 83%

Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion Models

Shengqu Cai, Duygu Ceylan, Matheus Gadelha, Chun-Hao Paul Huang, Tuanfeng Yang Wang, Gordon Wetzstein

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://primecai.github.io/generative_rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12190 2023-11-28 cs.CV 83%

DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors

Jinbo Xing, Menghan Xia, Yong Zhang, Haoxin Chen, Wangbo Yu, Hanyuan Liu, Xintao Wang, Tien-Tsin Wong, Ying Shan

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://doubiiu.github.io/projects/DynamiCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07771 2023-10-13 cs.CV cs.AI 83%

DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model

Xiaofan Li, Yifu Zhang, Xiaoqing Ye

专题命中 视频扩散模型 :video generation(title,abstract);long video(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13311 2023-10-12 cs.CV 83%

VDT: General-purpose Video Diffusion Transformers via Mask Modeling

Haoyu Lu, Guoxing Yang, Nanyi Fei, Yuqi Huo, Zhiwu Lu, Ping Luo, Mingyu Ding

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02562 2023-06-06 cs.CV 83%

Video Diffusion Models with Local-Global Context Guidance

Siyuan Yang, Lu Zhang, Yu Liu, Zhizhuo Jiang, You He

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted for publication at IJCAI 2023. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01329 2023-02-03 cs.CV 83%

Dreamix: Video Diffusion Models are General Video Editors

Eyal Molad, Eliahu Horwitz, Dani Valevski, Alex Rav Acha, Yossi Matias, Yael Pritch, Yaniv Leviathan, Yedid Hoshen

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17923 2026-05-19 cs.DC cs.AI cs.LG 82%

AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training

AdaptiveLoad: 向高效视频扩散变换器训练迈进

Yucheng Guo, Yongjian Guo, Zhong Guan, Haoran Sun, Wen Huang, Wanting Xu, Jing Long, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

AI总结 本文提出AdaptiveLoad框架,通过双约束自适应负载平衡系统和融合LayerNorm-Modulate CUDA内核,解决视频生成模型中大规模视频扩散变换器(如DiT和MMDiT)训练中的计算不平衡问题,实验显示其在Wan 2.1世界模型上提升了计算效率和训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07350 2025-12-09 cs.DC 82%

Communication-Efficient Serving for Video Diffusion Models with Latent Parallelism

面向视频扩散模型的通信高效服务与潜在并行性

Zhiyuan Wu, Shuai Wang, Li Chen, Kaihui Gao, Dan Li, Yanyu Ren, Qiming Zhang, Yong Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

AI总结 本文提出潜在并行性策略,通过动态旋转潜在空间维度,显著降低视频扩散模型服务的通信开销,同时保持生成质量。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16359 2025-11-18 cs.CR 82%

VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models

Xuming Hu, Hanqian Li, Jungang Li, Yu Huang, Shuliang Liu, Qi Zheng, Junhao Chen, Aiwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15874 2025-10-21 cs.GR 82%

Sketch-based Fluid Video Generation Using Motion-Guided Diffusion Models in Still Landscape Images

Hao Jin, Haoran Xie

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract)

Comments 2 pages, 5 figures. SIGGRAPH 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06133 2025-07-28 cs.CE 82%

Bridging Sequential Deep Operator Network and Video Diffusion: Residual Refinement of Spatio-Temporal PDE Solutions

Jaewan Park, Farid Ahmed, Kazuma Kobayashi, Seid Koric, Syed Bahauddin Alam, Iwona Jasiuk, Diab Abueidda

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19769 2025-06-25 cs.RO cs.AI 82%

TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning

Yuhui Chen, Haoran Li, Zhennan Jiang, Haowei Wen, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19454 2025-03-04 cs.GR 82%

TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis

Menghao Li, Zhenghao Zhang, Junchao Liao, Long Qin, Weizhi Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 81%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 视频扩散模型 :video generation(abstract,abstract_cn);video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23159 2026-07-31 cs.AI cs.CV cs.MM 版本更新 81%

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

CachedSearch:用于视频扩散测试时搜索的免训练缓存探索

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 81%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26266 2026-05-27 cs.LG cs.AI cs.CV cs.GR eess.IV 81%

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正

Tuna Tuncer, Felix Becker, Thomas Pfeil

机构 * Technical University of Munich(慕尼黑技术大学) Tensordyne

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。

Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 81%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22808 2026-04-28 cs.CV cs.AI eess.IV 81%

FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers

FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器

Haopeng Jin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。

Comments 24 pages, 17 figures, 14 tables, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 81%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09657 2026-03-11 cs.CV cs.AI cs.ET eess.IV 81%

When to Lock Attention: Training-Free KV Control in Video Diffusion

何时锁定注意力:视频扩散中的无训练KV控制

Tianyi Zeng, Jincheng Gao, Tianyi Wang, Zijie Meng, Miao Zhang, Jun Yin, Haoyuan Sun, Junfeng Jiao, Christian Claudel, Junbo Tan, Xueqian Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。

Comments 18 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10704 2025-12-30 cs.CV cs.MM 81%

Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework

自回归视频扩散模型的误差分析:一个统一的框架

Jing Wang, Fengzhuo Zhang, Xiaoli Li, Vincent Y. F. Tan, Tianyu Pang, Chao Du, Aixin Sun, Zhuoran Yang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Sea AI Lab(海思人工智能实验室) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13343 2025-10-01 cs.CV eess.IV 81%

Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds

Yushu Wu, Yanyu Li, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ke Ma, Arpit Sahni, Ju Hu, Aliaksandr Siarohin, Dhritiman Sagar, Yanzhi Wang, Sergey Tulyakov

机构 * Snap Inc.(Snap公司) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 21 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03897 2025-07-08 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Lei Zhao, Linfeng Feng, Dongxu Ge, Rujin Chen, Fangqiu Yi, Chi Zhang, Xiao-Lei Zhang, Xuelong Li

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Our demos are available at https://uniform-t2av.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19824 2025-06-10 cs.CV cs.GR cs.MM 81%

AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers

Jiazhi Guan, Kaisiyuan Wang, Zhiliang Xu, Quanwei Yang, Yasheng Sun, Shengyi He, Borong Liang, Yukang Cao, Yingying Li, Haocheng Feng, Errui Ding, Jingdong Wang, Youjian Zhao, Hang Zhou, Ziwei Liu

机构 * DCST, Tsinghua University(清华大学智能驾驶实验室) Baidu Inc.(百度公司) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Zhongguancun Laboratory(中关村实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. Project page: https://guanjz20.github.io/projects/AudCast

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08417 2025-03-12 cs.GR cs.AI cs.CV cs.LG cs.MM 81%

AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models

Kwan Yun, Seokhyeon Hong, Chaelin Kim, Junyong Noh

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 11 pages, 10 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04871 2025-03-10 cs.CV cs.LG eess.IV 81%

Toward Lightweight and Fast Decoders for Diffusion Models in Image and Video Generation

Alexey Buzovkin, Evgeny Shilov

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏