arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2511.12056 2025-11-18 cs.CV cs.AI cs.DC 79%

PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling

Sijie Wang, Qiang Wang, Shaohuai Shi

机构 * Sijie Wang, Qiang Wang, Shaohuai Shi(作者)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11343 2025-11-14 cs.CV stat.AP 79%

Latent Knowledge-Guided Video Diffusion for Scientific Phenomena Generation from a Single Initial Frame

Qinglong Cao, Xirui Li, Ding Wang, Chao Ma, Yuntian Chen, Xiaokang Yang

机构 * Eitech(艾tech)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13389 2025-10-29 cs.CV 79%

VSA: Faster Video Diffusion with Trainable Sparse Attention

Peiyuan Zhang, Yongqi Chen, Haofeng Huang, Will Lin, Zhengzhong Liu, Ion Stoica, Eric Xing, Hao Zhang

机构 * UC San Diego(UC圣迭戈大学) MBZUAI(穆桑大学人工智能研究所) UC Berkeley(伯克利大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18033 2025-10-17 cs.CV 79%

OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models

Dvir Samuel, Matan Levy, Nir Darshan, Gal Chechik, Rami Ben-Ari

机构 * Bar-Ilan University \& OriginAI Israel The Hebrew University of Jerusalem Israel Bar-Ilan University \& NVIDIA Research Israel Bar-Ilan University \& OriginAI The Hebrew University of Jerusalem Bar-Ilan University \& NVIDIA Research

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted to SIGGRAPH ASIA 2025. Project Page: https://dvirsamuel.github.io/omnimattezero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21593 2025-10-13 cs.CV cs.AI 79%

Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model

Yang Yang, Siming Zheng, Qirui Yang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments project page: https://vivocameraresearch.github.io/any2bokeh/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02851 2025-10-13 cs.CV cs.GR 79%

Human-VDM: Learning Single-Image 3D Human Gaussian Splatting from Video Diffusion Models

Zhibin Liu, Haoye Dong, Aviral Chharia, Hefeng Wu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 14 Pages, 8 figures, Project page: https://human-vdm.github.io/Human-VDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13934 2025-10-07 cs.CV 79%

DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization

Marzieh Gheisari, Auguste Genovesio

机构 * École Normale Supérieure PSL(巴黎高等师范学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01669 2025-10-06 cs.CV 79%

UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction

Jin Cao, Hongrui Wu, Ziyong Feng, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * State Key Lab of CAD&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) Tongji University(同济大学) DeepGlint

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments page: https://jin-cao-tma.github.io/UniVerse.github.io/ code: https://github.com/zju3dv/UniVerse

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23769 2025-10-02 cs.GR cs.AI cs.CV 79%

ReLumix: Extending Image Relighting to Video via Video Diffusion Models

Lezhong Wang, Shutong Jin, Ruiqi Cui, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Bigdeli

机构 * Technical University of Denmark(丹麦技术大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://lez-s.github.io/Relumix_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19296 2025-09-24 cs.CV cs.GR 79%

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/lyra/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03680 2025-09-05 cs.GR cs.AI cs.CV 79%

LuxDiT: Lighting Estimation with Video Diffusion Transformer

Ruofan Liang, Kai He, Zan Gojcic, Igor Gilitschenski, Sanja Fidler, Nandita Vijaykumar, Zian Wang

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/LuxDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00843 2025-09-03 cs.CV cs.AI 79%

Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion

Xueyang Kang, Zhengkang Xiang, Zezheng Zhang, Kourosh Khoshelham

机构 * University of Melbourne(墨尔本大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 26 pages, 30 figures, 2025 ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13188 2025-08-27 cs.CV 79%

StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models

Yunzhi Yan, Zhen Xu, Haotong Lin, Haian Jin, Haoyu Guo, Yida Wang, Kun Zhan, Xianpeng Lang, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * Zhejiang University(浙江大学) Li Auto Inc.(Li汽车公司) Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://zju3dv.github.io/street_crafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09667 2025-08-14 cs.CV 79%

GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors

Xingyilang Yin, Qi Zhang, Jiahao Chang, Ying Feng, Qingnan Fan, Xi Yang, Chi-Man Pun, Huaqi Zhang, Xiaodong Cun

机构 * University of Macau(澳门大学) VIVO CUHKSZ(香港中文大学) Xidian University(西安电子科技大学) GVC Lab, Great Bay University(大澳大学GVC实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08978 2025-08-13 cs.CV 79%

TaoCache: Structure-Maintained Video Generation Acceleration

Zhentao Fan, Zongzuo Wang, Weiwei Zhang

机构 * Huawei Inc.(华为公司)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08333 2025-08-12 cs.CV 79%

DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models

Hyeonwoo Kim, Sangwon Baik, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://snuvclab.github.io/david/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17539 2025-08-12 cs.CV 79%

Generating, Fast and Slow: Scalable Parallel Video Generation with Video Interface Networks

Bhishma Dedhia, David Bourgin, Krishna Kumar Singh, Yuheng Li, Yan Kang, Zhan Xu, Niraj K. Jha, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video generation(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06392 2025-08-11 cs.CV 79%

FVGen: Accelerating Novel-View Synthesis with Adversarial Video Diffusion Distillation

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04467 2025-08-07 cs.CV 79%

4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation

Shuzhou Yang, Xiaodong Cun, Xiaoyu Li, Yaowei Li, Jian Zhang

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03123 2025-08-07 cs.CV 79%

Dual-Expert Consistency Model for Efficient and High-Quality Video Generation

Zhengyao Lv, Chenyang Si, Tianlin Pan, Zhaoxi Chen, Kwan-Yee K. Wong, Yu Qiao, Ziwei Liu

机构 * Nanjing University(南京大学) The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments This paper has been accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08331 2025-08-07 cs.CV 79%

Go-with-the-Flow: Motion-Controllable Video Diffusion Models Using Real-Time Warped Noise

Ryan Burgert, Yuancheng Xu, Wenqi Xian, Oliver Pilarski, Pascal Clausen, Mingming He, Li Ma, Yitong Deng, Lingxiao Li, Mohsen Mousavi, Michael Ryoo, Paul Debevec, Ning Yu

机构 * Netflix Eyeline Studios(NetflixEyeline Studios) Netflix Stony Brook University(斯通布罗克大学) University of Maryland(马里兰大学) Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted to CVPR'25 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17350 2025-08-06 cs.CV 79%

Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer

Qingyu Shi, Jianzong Wu, Jinbin Bai, Jiangning Zhang, Lu Qi, Yunhai Tong, Xiangtai Li

机构 * PKU(北京大学) NTU(国立新加坡大学) NUS(新加坡国立大学) ZJU(浙江大学) UC Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04847 2025-08-05 cs.CV 79%

HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation

Qijun Gan, Yi Ren, Chen Zhang, Zhenhui Ye, Pan Xie, Xiang Yin, Zehuan Yuan, Bingyue Peng, Jianke Zhu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

Comments https://agnjason.github.io/HumanDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03140 2025-07-29 cs.CV 79%

Model Reveals What to Cache: Profiling-Based Feature Reuse for Video Diffusion Models

Xuran Ma, Yexin Liu, Yaofu Liu, Xianfeng Wu, Mingzhe Zheng, Zihao Wang, Ser-Nam Lim, Harry Yang

机构 * Hong Kong University of Science and Technology(香港科技大学) Everlyn AI University of Central Florida(佛罗里达中央大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19789 2025-07-29 cs.CV 79%

TransFlow: Motion Knowledge Transfer from Video Diffusion Models to Video Salient Object Detection

Suhwan Cho, Minhyeok Lee, Jungho Lee, Sunghun Yang, Sangyoun Lee

机构 * GenGenAI Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments ICCVW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16341 2025-07-23 cs.CV 79%

Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model

Mingtao Guo, Guanyu Xing, Yanci Zhang, Yanli Liu

机构 * National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, 610065, China(合成视觉基础科学国家重点实验室,四川大学,成都,610065,中国) School of Cyber Science and Engineering, Sichuan University, Chengdu, 610065, China(网络科学与工程学院,四川大学,成都,610065,中国) College of Computer Science, Sichuan University, Chengdu, 610065, China(计算机科学学院,四川大学,成都,610065,中国)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00704 2025-07-22 cs.GR cs.CV 79%

Controllable Weather Synthesis and Removal with Video Diffusion Models

Chih-Hao Lin, Zian Wang, Ruofan Liang, Yuxuan Zhang, Sanja Fidler, Shenlong Wang, Zan Gojcic

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments International Conference on Computer Vision (ICCV) 2025, Project Website: https://research.nvidia.com/labs/toronto-ai/WeatherWeaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11992 2025-07-14 cs.CV 79%

SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations

Songchun Zhang, Huiyao Xu, Sitong Guo, Zhongwei Xie, Hujun Bao, Weiwei Xu, Changqing Zou

机构 * ZJU(浙江大学) HKUST(香港科技大学) Zhejiang Lab(浙江实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05678 2025-07-09 cs.CV 79%

LiON-LoRA: Rethinking LoRA Fusion to Unify Controllable Spatial and Temporal Generation for Video Diffusion

Yisu Zhang, Chenjie Cao, Chaohui Yu, Jianke Zhu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(虎扑实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02813 2025-07-04 cs.CV 79%

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Fangfu Liu, Hao Li, Jiawei Chi, Hanyang Wang, Minghui Yang, Fudong Wang, Yueqi Duan

机构 * Tsinghua University(清华大学) NTU(国立科技大学) Ant Group(蚂蚁集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://liuff19.github.io/LangScene-X

详情

展开后加载摘要…

URL PDF HTML 收藏