arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2502.00639 2025-09-30 cs.CV cs.AI cs.LG stat.ML 57%

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Tao Ren, Zishi Zhang, Jingyang Jiang, Zehao Li, Shentao Qin, Yi Zheng, Guanghao Li, Qianyou Sun, Yan Li, Jiafeng Liang, Xinping Li, Yijie Peng

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00796 2025-09-30 cs.LG cs.AI cs.CV 57%

Diffusion Models: A Comprehensive Survey of Methods and Applications

Ling Yang, Zhilong Zhang, Yang Song, Shenda Hong, Runsheng Xu, Yue Zhao, Wentao Zhang, Bin Cui, Ming-Hsuan Yang

机构 * Peking University(北京大学) OpenAI University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) University of California at Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 59 pages, 19 figures, citing 396 (up-to-date) papers, project: https://github.com/YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy, accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06028 2025-09-24 cs.CV 57%

SparseDiT: Token Sparsification for Efficient Diffusion Transformer

Shuning Chang, Pichao Wang, Jiasheng Tang, Fan Wang, Yi Yang

机构 * Zhejiang University(浙江大学) Damo Academy, Alibaba Group(阿里达摩院) Hupan Lab(虎斑实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01799 2025-09-17 cs.CV 57%

WorldExplorer: Towards Generating Fully Navigable 3D Scenes

Manuel-Andreas Schneider, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025. Project page: see https://mschneider456.github.io/world-explorer, video: see https://youtu.be/N6NJsNyiv6I, code: https://github.com/mschneider456/WorldExplorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21070 2025-08-29 cs.CV cs.LG 57%

Dress&Dance: Dress up and Dance as You Like It - Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/DressAndDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19852 2025-08-29 cs.CV 57%

Ego-centric Predictive Model Conditioned on Hand Trajectories

Binjie Zhang, Mike Zheng Shou

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Code: github.com/showlab/Ego-PM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19204 2025-08-27 cs.CV cs.AI cs.GR 57%

LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding

Julian Ost, Andrea Ramazzina, Amogh Joshi, Maximilian Bömer, Mario Bijelic, Felix Heide

机构 * Julian Ost(未知) Andrea Ramazzina(未知) Amogh Joshi(未知) Maximilian Bömer(未知) Mario Bijelic(未知) Felix Heide(未知)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://light.princeton.edu/LSD-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16930 2025-08-26 eess.AS cs.CV cs.SD 57%

HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Sizhe Shan, Qiulin Li, Yutao Cui, Miles Yang, Yuehai Wang, Qun Yang, Jin Zhou, Zhao Zhong

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16212 2025-08-26 cs.CV cs.AI cs.LG 57%

OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models

Huanpeng Chu, Wei Wu, Guanyu Fen, Yutao Zhang

机构 * Zhipu AI(智谱AI)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16211 2025-08-25 cs.CV 57%

Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers

Shikang Zheng, Liang Feng, Xinyu Wang, Qinming Zhou, Peiliang Cai, Chang Zou, Jiacheng Liu, Yuqi Lin, Junjie Chen, Yue Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Fudan University(复旦大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08170 2025-08-22 cs.CV 57%

ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction

Chaojun Ni, Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Wenkang Qin, Xinze Chen, Guanghong Jia, Guan Huang, Wenjun Mei

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14811 2025-08-21 cs.CV 57%

Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Canyu Zhao, Xiaoman Li, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://aim-uofa.github.io/Tinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13300 2025-08-20 cs.CV cs.AI 57%

GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(CRCV,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13154 2025-08-19 cs.CV 57%

4DNeX: Feed-Forward 4D Generative Modeling Made Easy

Zhaoxi Chen, Tianqi Liu, Long Zhuo, Jiawei Ren, Zeng Tao, He Zhu, Fangzhou Hong, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://4dnex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10905 2025-08-19 cs.CV cs.HC 57%

InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation

Yukang Lin, Yan Hong, Zunnan Xu, Xindi Li, Chao Xu, Chuanbiao Song, Ronghui Li, Haoxing Chen, Jun Lan, Huijia Zhu, Weiqiang Wang, Jianfu Zhang, Xiu Li

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accept to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07603 2025-08-12 cs.CV 57%

LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation

Wenhui Song, Hanhui Li, Jiehui Huang, Panwen Hu, Yuhao Cheng, Long Chen, Yiqiang Yan, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) Lenovo Research(联想研究)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07557 2025-08-12 cs.CV 57%

Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation

Minghao Yin, Yukang Cao, Songyou Peng, Kai Han

机构 * The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07246 2025-08-12 cs.CV 57%

Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers

Xin Ma, Yaohui Wang, Genyun Jia, Xinyuan Chen, Tien-Tsin Wong, Cunjian Chen

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://maxin-cn.github.io/miramo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21205 2025-08-12 cs.CV 57%

EF-VI: Enhancing End-Frame Injection for Video Inbetweening

Liuhan Chen, Xiaodong Cun, Xiaoyu Li, Xianyi He, Shenghai Yuan, Jie Chen, Ying Shan, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) GVC Lab, Great Bay University(大湾大学GVC实验室) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Rabbitpre Intelligence(Rabbitpre智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06014 2025-08-11 cs.CV 57%

ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors

Minsu Kim, Subin Jeon, In Cho, Mijin Yoo, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 10 pages, 6 Figures, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01603 2025-08-08 cs.CV 57%

DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation

Yue-Jiang Dong, Wang Zhao, Jiale Xu, Ying Shan, Song-Hai Zhang

机构 * Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Homepage: https://yuejiangdong.github.io/depthsync

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03480 2025-08-06 cs.CV cs.AI 57%

VideoGuard: Protecting Video Content from Unauthorized Editing

Junjie Cao, Kaizhou Li, Xinchun Yu, Hongxiang Li, Xiaoping Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ai security, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02807 2025-08-06 cs.CV 57%

DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework

Tongchun Zuo, Zaiyu Huang, Shuliang Ning, Ente Lin, Chao Liang, Zerong Zheng, Jianwen Jiang, Yuan Zhang, Mingyuan Gao, Xin Dong

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14404 2025-08-06 cs.CV cs.AI 57%

Causally Steered Diffusion for Automated Video Counterfactual Generation

Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios, Thomas Melistas, Nefeli Gkouti, Yannis Panagakis, Giorgos Papanastasiou, Sotirios A. Tsaftaris

机构 * Spotify, UK(英国Spotify)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12049 2025-08-05 cs.CV 57%

TACO: Taming Diffusion for in-the-wild Video Amodal Completion

Ruijie Lu, Yixin Chen, Yu Liu, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI 通用人工智能国家重点实验室) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15580 2025-08-05 cs.CV 57%

TKG-DM: Training-free Chroma Key Content Generation Diffusion Model

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou

机构 * Faculty of Science and Engineering(科学与工程学部) RPTU Kaiserslautern-Landau & DFKI GmbH(科隆-兰道大学与DFKI GmbH)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20158 2025-07-29 cs.CV 57%

AnimeColor: Reference-based Animation Colorization with Diffusion Transformers

Yuhong Zhang, Liyao Wang, Han Wang, Danni Wu, Zuzeng Lin, Feng Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Communication University of China(中国通信大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 57%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03456 2025-07-29 cs.CV 57%

LM-Gaussian: Boost Sparse-view 3D Gaussian Splatting with Large Model Priors

Hanyang Yu, Xiaoxiao Long, Ping Tan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://hanyangyu1021.github.io/lm-gaussian.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏