arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2603.14241 2026-03-17 cs.CV 83%

CamLit: Unified Video Diffusion with Explicit Camera and Lighting Control

CamLit:统一的视频扩散模型,具有显式相机和光照控制

Zhiyi Kuang, Chengan He, Egor Zakharov, Yuxuan Xue, Shunsuke Saito, Olivier Maury, Timur Bagautdinov, Youyi Zheng, Giljoo Nam

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 CamLit首次提出统一的视频扩散模型,结合生成新视角和光照重置,通过单张图像、相机轨迹和环境映射生成高质量视频,实现高精度的相机姿态和光照控制。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04446 2026-03-17 cs.CV 83%

DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models

DiCoDe:扩散压缩深度标记用于语言模型的自回归视频生成

Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Ping Luo

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 DiCoDe利用扩散压缩深度标记,通过自回归语言模型生成视频,实现高效压缩与高质量输出,展示了在视频建模中的潜力。

Comments Project Page: https://liyz15.github.io/DiCoDe

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04016 2026-03-10 cs.CV 83%

S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

S$^2$Q-VDiT: 精确量化视频扩散变换器与显著数据和稀疏令牌蒸馏

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 S$^2$Q-VDiT通过显著数据选择和稀疏令牌蒸馏提升视频扩散变换器的量化性能,实现无损压缩和加速推理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02882 2026-03-04 cs.CV 83%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI 83%

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13789 2026-03-03 cs.CV cs.AI 83%

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

BWCache: 通过块级缓存加速视频扩散变换器

Hanshuai Cui, Zhiqing Tang, Zhifei Xu, Zhi Yao, Wenyi Zeng, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai 519087, China(人工智能与未来网络研究院,北京师范大学,珠海)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 BWCache通过块级缓存技术加速视频扩散变换器,减少计算冗余,提升生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18950 2026-03-03 cs.CV 83%

Target-Aware Video Diffusion Models

面向目标的视频扩散模型

Taeksoo Kim, Hanbyul Joo

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出一种面向目标的视频扩散模型,通过引入目标掩码和特殊标记提升视频生成中演员与目标的互动准确性,并在两个下游任务中验证其有效性。

Comments ICLR 2026. The project page is available at https://taeksuu.github.io/tavid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05016 2026-02-24 cs.CV 83%

Generative Neural Video Compression via Video Diffusion Prior

基于视频扩散先验的生成神经视频压缩

Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma

机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。

Comments accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS 83%

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18537 2026-02-03 cs.CV 83%

Zero-Shot Video Deraining with Video Diffusion Models

无监督视频去雨与视频扩散模型

Tuomas Varanka, Juan Luis Gonzalez, Hyeongwoo Kim, Pablo Garrido, Xu Yao

机构 * University of Oulu(奥卢大学) Flawless AI Imperial College London(伦敦帝国理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种无需合成数据和模型微调的无监督视频去雨方法,通过预训练文本到视频扩散模型,利用注意力切换机制提升动态场景中的去雨效果。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22275 2026-02-02 cs.CV cs.AI 83%

VMonarch: Efficient Video Diffusion Transformers with Structured Attention

VMonarch:具有结构注意力的高效视频扩散变换器

Cheng Liang, Haoxian Chen, Liang Hou, Qi Fan, Gangshan Wu, Xin Tao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 VMonarch通过结构化注意力机制提升视频扩散变换器的效率,减少计算量并提高处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21922 2026-01-30 cs.CV 83%

Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models

借助视频扩散模型的零样本视频修复与增强

Cong Cao, Huanjing Yue, Shangbin Xie, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(电子信息工程学院,天津大学) Computer Vision and Pattern Recognition Laboratory, School of Engineering Science, Lappeenranta-Lahti University of Technology LUT(计算机视觉与模式识别实验室,工程科学学院,拉佩兰塔-拉赫蒂技术大学LUT)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出一种无训练的框架,利用视频扩散模型提升零样本视频修复与增强的时序一致性,通过潜在融合与后处理策略增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20499 2026-01-29 cs.CV 83%

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12761 2026-01-21 cs.CV 83%

Moaw: Unleashing Motion Awareness for Video Diffusion Models

Moaw:释放视频扩散模型中的运动感知

Tianqi Zhang, Ziyi Wang, Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Zhengyang Huang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05722 2026-01-12 cs.CV 83%

Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation

旋转你的角色:重新审视视频扩散模型用于高质量3D角色生成

Jin Wang, Jianxiang Lu, Comi Chen, Guangzheng Xu, Haoyu Yang, Peng Chen, Na Zhang, Yifan Xu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * Hunyuan, Tencent(腾讯文予实验室) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出RCM模型,通过旋转角色姿势实现高质量3D角色生成和新视角合成,支持多视角输入和高分辨率视频生成。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21855 2026-01-12 cs.CV 83%

ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling

ReVision: 通过显式3D运动建模改进视频扩散

Qihao Liu, Ju He, Qihang Yu, Liang-Chieh Chen, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ReVision通过整合参数化的3D运动模型,提升视频生成中复杂动作和交互的真实性和可控性。

Comments TMLR camera-ready version. Project Page: https://revision-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04342 2026-01-09 cs.CV 83%

ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

ReHyAt:用于视频扩散变换器的递归混合注意力

Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ReHyAt通过结合softmax和线性注意力,实现高效的视频扩散模型,降低训练成本并提升长序列生成的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24227 2026-01-01 cs.CV 83%

Mirage: One-Step Video Diffusion for Photorealistic and Coherent Asset Editing in Driving Scenes

Mirage: 驾驶场景中光实且一致的资产编辑一步视频扩散

Shuyun Wang, Haiyang Sun, Bing Wang, Hangjun Ye, Xin Yu

机构 * The University of Queensland(昆士兰大学) Xiaomi EV(小米电动车)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Mirage提出了一种用于驾驶场景中光实且一致的资产编辑的一步视频扩散模型,通过引入时序无关的潜在特征和两阶段数据对齐策略,提升了视觉保真度和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22626 2025-12-30 cs.CV 83%

Envision: Embodied Visual Planning via Goal-Imagery Video Diffusion

Envision:通过目标图像视频扩散进行具身视觉规划

Yuming Gu, Yizhi Wang, Yining Hong, Yipeng Gao, Hao Jiang, Angtian Wang, Bo Liu, Nathaniel S. Dennler, Zhengfei Kuang, Hao Li, Gordon Wetzstein, Chongyang Ma

机构 * University of Southern California(南加州大学) ByteDance(字节跳动) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 Envision 通过目标图像视频扩散模型实现具身视觉规划,提升目标对齐和空间一致性,支持下游机器人任务。

Comments Page: https://envision-paper.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21019 2025-12-29 cs.CV 83%

Phased One-Step Adversarial Equilibrium for Video Diffusion Models

相位单步对抗均衡用于视频扩散模型

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Hongyi Henry Jin, Kai Yu, Peng Zhang, Wenyue Li, Yuan Zhou, Tianxiang Zheng, Qinglin Lu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 V-PAE通过相位单步对抗均衡方法提升大规模视频模型的生成质量与效率,实现高质量视频生成并显著降低扩散延迟。

Comments Accepted by AAAI 2026. Project Page: https://v-pae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21268 2025-12-25 cs.CV 83%

ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision

ACD: 通过注意力监督实现视频扩散模型的直接条件控制

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Yonsei University(延世大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18772 2025-12-23 cs.CV 83%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17253 2025-12-22 cs.CV 83%

Mitty: Diffusion-based Human-to-Robot Video Generation

Mitty:基于扩散的Human-to-Robot视频生成

Yiren Song, Cheng Liu, Weijia Mao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Mitty通过基于扩散的变换器实现端到端的人机视频生成,利用预训练模型和双向注意力机制,无需动作标签或中间抽象,生成高质量的机器人执行视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG 83%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05754 2025-12-08 cs.CV 83%

USV: Unified Sparsification for Accelerating Video Diffusion Models

USV:统一稀疏化以加速视频扩散模型

Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 USV通过统一稀疏化策略提升视频扩散模型的效率,实现去噪速度提升83.3%和端到端加速22.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV 83%

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 83%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16864 2025-11-25 cs.CV 83%

Training-Free Efficient Video Generation via Dynamic Token Carving

无需训练的高效视频生成 via 动态令牌雕刻

Yuechen Zhang, Jinbo Xing, Bin Xia, Shaoteng Liu, Bohao Peng, Xin Tao, Pengfei Wan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Jenga通过动态注意力雕刻和逐步分辨率生成,实现无需训练的高效视频生成,显著提升生成速度并保持生成质量。

Comments NeurIPS 2025, Project Page: https://julianjuaner.github.io/projects/jenga/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24899 2025-11-18 cs.CV 83%

Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer

Mohsen Ghafoorian, Denis Korzhenkov, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00652 2025-11-18 cs.CV cs.CR 83%

Video Signature: Implicit Watermarking for Video Diffusion Models

Yu Huang, Junhao Chen, Shuliang Liu, Hanqian Li, Jungang Li, Qi Zheng, Aiwei Liu, Yi R. Fung, Xuming Hu

机构 * AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能 thrust) Hong Kong University of Science and Technology(香港科学与技术大学) School of Software, BNRist, Tsinghua University(清华大学软件学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏