arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2502.19454 2025-03-04 cs.GR 82%

TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis

Menghao Li, Zhenghao Zhang, Junchao Liao, Long Qin, Weizhi Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 81%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 视频扩散模型 :video generation(abstract,abstract_cn);video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23159 2026-07-31 cs.AI cs.CV cs.MM 版本更新 81%

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

CachedSearch:用于视频扩散测试时搜索的免训练缓存探索

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 81%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26266 2026-05-27 cs.LG cs.AI cs.CV cs.GR eess.IV 81%

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正

Tuna Tuncer, Felix Becker, Thomas Pfeil

机构 * Technical University of Munich(慕尼黑技术大学) Tensordyne

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。

Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 81%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22808 2026-04-28 cs.CV cs.AI eess.IV 81%

FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers

FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器

Haopeng Jin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。

Comments 24 pages, 17 figures, 14 tables, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 81%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09657 2026-03-11 cs.CV cs.AI cs.ET eess.IV 81%

When to Lock Attention: Training-Free KV Control in Video Diffusion

何时锁定注意力:视频扩散中的无训练KV控制

Tianyi Zeng, Jincheng Gao, Tianyi Wang, Zijie Meng, Miao Zhang, Jun Yin, Haoyuan Sun, Junfeng Jiao, Christian Claudel, Junbo Tan, Xueqian Wang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。

Comments 18 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10704 2025-12-30 cs.CV cs.MM 81%

Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework

自回归视频扩散模型的误差分析:一个统一的框架

Jing Wang, Fengzhuo Zhang, Xiaoli Li, Vincent Y. F. Tan, Tianyu Pang, Chao Du, Aixin Sun, Zhuoran Yang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Singapore University of Technology and Design(新加坡科技设计大学) Sea AI Lab(海思人工智能实验室) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13343 2025-10-01 cs.CV eess.IV 81%

Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds

Yushu Wu, Yanyu Li, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ke Ma, Arpit Sahni, Ju Hu, Aliaksandr Siarohin, Dhritiman Sagar, Yanzhi Wang, Sergey Tulyakov

机构 * Snap Inc.(Snap公司) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 21 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03897 2025-07-08 cs.MM cs.AI cs.CV cs.SD eess.AS 81%

UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation

Lei Zhao, Linfeng Feng, Dongxu Ge, Rujin Chen, Fangqiu Yi, Chi Zhang, Xiao-Lei Zhang, Xuelong Li

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Our demos are available at https://uniform-t2av.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19824 2025-06-10 cs.CV cs.GR cs.MM 81%

AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers

Jiazhi Guan, Kaisiyuan Wang, Zhiliang Xu, Quanwei Yang, Yasheng Sun, Shengyi He, Borong Liang, Yukang Cao, Yingying Li, Haocheng Feng, Errui Ding, Jingdong Wang, Youjian Zhao, Hang Zhou, Ziwei Liu

机构 * DCST, Tsinghua University(清华大学智能驾驶实验室) Baidu Inc.(百度公司) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Zhongguancun Laboratory(中关村实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. Project page: https://guanjz20.github.io/projects/AudCast

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08417 2025-03-12 cs.GR cs.AI cs.CV cs.LG cs.MM 81%

AnyMoLe: Any Character Motion In-betweening Leveraging Video Diffusion Models

Kwan Yun, Seokhyeon Hong, Chaelin Kim, Junyong Noh

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

Comments 11 pages, 10 figures, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04871 2025-03-10 cs.CV cs.LG eess.IV 81%

Toward Lightweight and Fast Decoders for Diffusion Models in Image and Video Generation

Alexey Buzovkin, Evgeny Shilov

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12604 2025-01-23 eess.IV cs.CV cs.LG 81%

Image Motion Blur Removal in the Temporal Dimension with Video Diffusion Models

Wang Pang, Zhihao Zhan, Xiang Zhu, Yechao Bai

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06449 2024-11-12 cs.CV eess.IV 81%

Improved Video VAE for Latent Video Diffusion Model

Pingyu Wu, Kai Zhu, Yu Liu, Liming Zhao, Wei Zhai, Yang Cao, Zheng-Jun Zha

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03035 2024-09-09 eess.IV cs.CV 81%

Training-Free Condition Video Diffusion Models for single frame Spatial-Semantic Echocardiogram Synthesis

Van Phi Nguyen, Tri Nhan Luong Ha, Huy Hieu Pham, Quoc Long Tran

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

Comments Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06465 2024-06-11 cs.CV cs.AI cs.CL cs.LG cs.MM 81%

AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction

Zhen Xing, Qi Dai, Zejia Weng, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11388 2022-12-06 cs.CV cs.AI cs.MM 81%

LGDN: Language-Guided Denoising Network for Video-Language Modeling

Haoyu Lu, Mingyu Ding, Nanyi Fei, Yuqi Huo, Zhiwu Lu

专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by NeurIPS2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07515 2021-12-15 cs.CV cs.AI cs.CL cs.MM 81%

CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising

Jianjie Luo, Yehao Li, Yingwei Pan, Ting Yao, Hongyang Chao, Tao Mei

专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM

Comments ACM Multimedia 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-08-21 cs.CV 新提交 79%

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: https://ggxxii.github.io/dreamhand/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13205 2026-08-14 cs.CV 新提交 79%

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27345 2026-08-13 cs.CV 版本更新 79%

SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers

RayPE: 用于3D感知视频生成的射线空间位置编码

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) ARC Lab, Tencent(腾讯ARC Lab)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。

Comments Project page: https://visual-ai.github.io/scope/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14513 2026-08-11 cs.CV cs.AI 版本更新 79%

HEART: Exploiting Head Heterogeneity in Sparse Attention for Video Diffusion

HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速

Xuzhe Zheng, Yuexiao Ma, Jing Xu, Xiawu Zheng, Rongrong Ji, Fei Chao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07463 2026-08-10 cs.CV cs.LG 新提交 79%

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

MirrorWorld:利用视频扩散模型生成镜像反射

Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。

Comments Project Page: https://youjunzhao.github.io/MirrorWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05237 2026-08-07 cs.CV cs.AI 新提交 79%

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

上下文强制:揭示自回归视频扩散中的上下文效应

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Tencent Youtu Lab(腾讯云图实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04701 2026-08-06 cs.CV 新提交 79%

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

UniWorld-View:基于视频扩散模型的大基线视图合成

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

机构 * Peking University(北京大学) Rabbitpre AI

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。

Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View

详情

展开后加载摘要…

URL PDF HTML 收藏