arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-03 至 2026-03-03 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 10 篇

2603.00194 2026-03-03 cs.CV cs.AI cs.CR 89%

SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models

SKeDA:一种面向文本到视频扩散模型的生成水印框架

Yang Yang, Xinze Zou, Zehua Ma, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Anhui Province Key Laboratory of Digital Security and the CAS Key Laboratory of Electromagnetic Space Information, University of Science and Technology of China(安徽省数字安全重点实验室和中国科学院电磁空间信息重点实验室,中国科学技术大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SKeDA是一种专为文本到视频扩散模型设计的生成水印框架,通过分布保持采样和差分注意机制提升水印的鲁棒性和可靠性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13789 2026-03-03 cs.CV cs.AI 83%

BWCache: Accelerating Video Diffusion Transformers through Block-Wise Caching

BWCache: 通过块级缓存加速视频扩散变换器

Hanshuai Cui, Zhiqing Tang, Zhifei Xu, Zhi Yao, Wenyi Zeng, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai 519087, China(人工智能与未来网络研究院,北京师范大学,珠海)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 BWCache通过块级缓存技术加速视频扩散变换器,减少计算冗余,提升生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18950 2026-03-03 cs.CV 83%

Target-Aware Video Diffusion Models

面向目标的视频扩散模型

Taeksoo Kim, Hanbyul Joo

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出一种面向目标的视频扩散模型,通过引入目标掩码和特殊标记提升视频生成中演员与目标的互动准确性,并在两个下游任务中验证其有效性。

Comments ICLR 2026. The project page is available at https://taeksuu.github.io/tavid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20123 2026-03-03 cs.CV 79%

UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers

UltraViCo: 突破视频扩散变换器的 extrapolation 限制

Min Zhao, Hongzhou Zhu, Yingze Wang, Bokai Yan, Jintao Zhang, Guande He, Ling Yang, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, Tsinghua University(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,清华大学) ShengShu(盛书) Gaoling School of Artificial Intelligence, Renmin University of China(北京理工大学人工智能学院,中国人民大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 UltraViCo通过抑制超出训练窗口的token注意力,突破视频扩散变换器的extrapolation限制,提升泛化能力和性能。

Comments ICLR2026. Project page: https://thu-ml.github.io/UltraViCo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01623 2026-03-03 cs.CV cs.LG 70%

Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration

自适应频谱特征预测用于扩散采样加速

Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Spectrum方法,通过切比雪夫多项式近似实现全局长距离特征重用,提升扩散采样速度并保持高质量样本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11484 2026-03-03 cs.CV 70%

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频

Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。

Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02129 2026-03-03 cs.CV cs.AI 57%

LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation

LiftAvatar:基于运动空间的表达控制3D高斯人偶动画

Hualiang Wei, Shunran Jia, Jialun Liu, Wenhui Li

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01096 2026-03-03 cs.CV cs.AI cs.CL cs.LG 57%

Unified Vision-Language Modeling via Concept Space Alignment

通过概念空间对齐实现统一的视觉-语言建模

Yifu Qiu, Paul-Ambroise Duquenne, Holger Schwenk

机构 * University of Edinburgh(爱丁堡大学) FAIR at Meta(Meta公司FAIR团队)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV 57%

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23258 2026-03-03 cs.CV 57%

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

通过累积误差最小化实现扩散变换器加速的即插即用保真优化

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。

Comments 29 pages, ICLR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏