arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2504.07961 2025-08-20 cs.CV 70%

Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction

Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

Comments 17 pages, 6 figures, ICCV 2025 Highlight, Project page: https://geo4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08086 2025-08-12 cs.CV cs.GR 70%

Matrix-3D: Omnidirectional Explorable 3D World Generation

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, Eric Li, Yang Liu, Yikai Wang, Hao-Xiang Guo, Yahui Zhou

机构 * Skywork AI Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23287 2025-08-08 cs.CV 70%

ReferEverything: Towards Segmenting Everything We Can Speak of in Videos

Anurag Bagchi, Zhipeng Bao, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究 institute)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page at https://refereverything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17744 2025-07-24 cs.CV cs.AI cs.HC 70%

Yume: An Interactive World Generation Model

Xiaofeng Mao, Shaoheng Lin, Zhen Li, Chuanhao Li, Wenshuo Peng, Tong He, Jiangmiao Pang, Mingmin Chi, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08676 2025-07-22 cs.CV cs.GR 70%

FlexiClip: Locality-Preserving Free-Form Character Animation

Anant Khandelwal

机构 * Search Technology Center India, Microsoft, IDC, Bengaluru, India(Bharat)(印度搜索技术中心、微软、IDC、班加罗尔、印度(巴哈拉特))

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 13 pages, 4 figures, 7 tables, Accepted in ICML 2025, https://openreview.net/forum?id=xtxCM4XZ82

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11167 2025-07-17 cs.CV cs.AI 70%

Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video Reconstruction

Haonan Wang, Qixiang Zhang, Lehan Wang, Xuanqi Huang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04720 2025-07-11 cs.CV 70%

FluidNexus: 3D Fluid Reconstruction and Prediction from a Single Video

Yue Gao, Hong-Xing Yu, Bo Zhu, Jiajun Wu

机构 * Stanford University(斯坦福大学) Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments CVPR 2025 (oral). The first two authors contributed equally. Project website: https://yuegao.me/FluidNexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24113 2025-07-01 cs.CV 70%

Epona: Autoregressive Diffusion World Model for Autonomous Driving

Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiao-Xiao Long, Xun Cao, Wei Yin

机构 * Horizon Robotics Tsinghua University(清华大学) Peking University(北京大学) Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文心)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV2025, Project Page: https://kevin-thu.github.io/Epona/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10494 2025-06-11 cs.CV cs.AI cs.LG cs.PF 70%

SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device

Yushu Wu, Zhixing Zhang, Yanyu Li, Yanwu Xu, Anil Kag, Yang Sui, Huseyin Coskun, Ke Ma, Aleksei Lebedev, Ju Hu, Dimitris Metaxas, Yanzhi Wang, Sergey Tulyakov, Jian Ren

机构 * Snap Inc. Northeastern University(东北大学) Rutgers University(罗格斯大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments https://snap-research.github.io/snapgen-v/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01546 2025-06-03 cs.CV 70%

LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model

Xiaodong Wang, Zhirong Wu, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments project homepage: https://wang-xiaodong1899.github.io/longdwm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19911 2025-05-08 cs.CV 70%

Replace Anyone in Videos

Xiang Wang, Shiwei Zhang, Haonan Qiu, Ruihang Chu, Zekun Li, Yingya Zhang, Changxin Gao, Yuehuan Wang, Chunhua Shen, Nong Sang

机构 * Key Laboratory of Ministry of Education for Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11934 2025-04-29 cs.CV cs.AI 70%

SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input

Zhen Lv, Yangqi Long, Congzhentao Huang, Cao Li, Chengfei Lv, Hao Ren, Dian Zheng

机构 * Alibaba Group(阿里巴巴集团) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments website, see https://spatialdreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11389 2025-04-21 cs.GR cs.AI cs.CV 70%

VideoPanda: Video Panoramic Diffusion with Multi-view Attention

Kevin Xie, Amirmojtaba Sabour, Jiahui Huang, Despoina Paschalidou, Greg Klar, Umar Iqbal, Sanja Fidler, Xiaohui Zeng

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project website at https://research.nvidia.com/labs/toronto-ai/VideoPanda/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17934 2025-03-25 cs.CV 70%

TransAnimate: Taming Layer Diffusion to Generate RGBA Video

Xuewei Chen, Zhimin Chen, Yiren Song

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06674 2025-03-13 cs.CV 70%

Learning Few-Step Diffusion Models by Trajectory Distribution Matching

Yihong Luo, Tianyang Hu, Jiacheng Sun, Yujun Cai, Jing Tang

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://tdm-t2x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08665 2025-03-12 cs.CV cs.AI cs.LG 70%

REGEN: Learning Compact Video Embedding with (Re-)Generative Decoder

Yitian Zhang, Long Mai, Aniruddha Mahapatra, David Bourgin, Yicong Hong, Jonah Casebeer, Feng Liu, Yun Fu

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07659 2025-03-12 cs.CV 70%

MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion

Onkar Susladkar, Jishu Sen Gupta, Chirag Sehgal, Sparsh Mittal, Rekha Singhal

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted in ICLR 2025 (spotlight paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21314 2025-03-10 cs.CV 70%

Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos

Zhiyu Tan, Junyan Wang, Hao Yang, Luozheng Qin, Hesen Chen, Qiang Zhou, Hao Li

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17470 2025-03-03 cs.CV 70%

SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency

Yiming Xie, Chun-Han Yao, Vikram Voleti, Huaizu Jiang, Varun Jampani

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://sv4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09038 2025-02-28 cs.CV cs.AI cs.GR cs.LG 70%

Do generative video models understand physical principles?

Saman Motamed, Laura Culp, Kevin Swersky, Priyank Jaini, Robert Geirhos

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10248 2025-02-25 cs.CV cs.CL 70%

Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model

Guoqing Ma, Haoyang Huang, Kun Yan, Liangyu Chen, Nan Duan, Shengming Yin, Changyi Wan, Ranchen Ming, Xiaoniu Song, Xing Chen, Yu Zhou, Deshan Sun, Deyu Zhou, Jian Zhou, Kaijun Tan, Kang An, Mei Chen, Wei Ji, Qiling Wu, Wen Sun, Xin Han, Yanan Wei, Zheng Ge, Aojie Li, Bin Wang, Bizhu Huang, Bo Wang, Brian Li, Changxing Miao, Chen Xu, Chenfei Wu, Chenguang Yu, Dapeng Shi, Dingyuan Hu, Enle Liu, Gang Yu, Ge Yang, Guanzhe Huang, Gulin Yan, Haiyang Feng, Hao Nie, Haonan Jia, Hanpeng Hu, Hanqi Chen, Haolong Yan, Heng Wang, Hongcheng Guo, Huilin Xiong, Huixin Xiong, Jiahao Gong, Jianchang Wu, Jiaoren Wu, Jie Wu, Jie Yang, Jiashuai Liu, Jiashuo Li, Jingyang Zhang, Junjing Guo, Junzhe Lin, Kaixiang Li, Lei Liu, Lei Xia, Liang Zhao, Liguo Tan, Liwen Huang, Liying Shi, Ming Li, Mingliang Li, Muhua Cheng, Na Wang, Qiaohui Chen, Qinglin He, Qiuyan Liang, Quan Sun, Ran Sun, Rui Wang, Shaoliang Pang, Shiliang Yang, Sitong Liu, Siqi Liu, Shuli Gao, Tiancheng Cao, Tianyu Wang, Weipeng Ming, Wenqing He, Xu Zhao, Xuelin Zhang, Xianfang Zeng, Xiaojia Liu, Xuan Yang, Yaqi Dai, Yanbo Yu, Yang Li, Yineng Deng, Yingming Wang, Yilei Wang, Yuanwei Lu, Yu Chen, Yu Luo, Yuchu Luo, Yuhe Yin, Yuheng Feng, Yuxiang Yang, Zecheng Tang, Zekai Zhang, Zidong Yang, Binxing Jiao, Jiansheng Chen, Jing Li, Shuchang Zhou, Xiangyu Zhang, Xinhao Zhang, Yibo Zhu, Heung-Yeung Shum, Daxin Jiang

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01784 2025-02-05 cs.RO cs.CV 70%

VILP: Imitation Learning with Latent Video Planning

Zhengtong Xu, Qiang Qiu, Yu She

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00500 2025-02-05 cs.CV cs.AI cs.LG 70%

Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation

Yang Cao, Zhao Song, Chiwun Yang

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11325 2025-01-22 cs.CV cs.AI 70%

CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation

Zheng Chong, Wenqing Zhang, Shiyue Zhang, Jun Zheng, Xiao Dong, Haoxiang Li, Yiling Wu, Dongmei Jiang, Xiaodan Liang

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments 11 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10018 2025-01-20 cs.CV 70%

DiffuEraser: A Diffusion Model for Video Inpainting

Xiaowen Li, Haolan Xue, Peiran Ren, Liefeng Bo

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 11pages, 13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18103 2025-01-09 cs.LG cs.CV 70%

Tutorial on Diffusion Models for Imaging and Vision

Stanley H. Chan

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00601 2025-01-07 cs.CV cs.AI cs.GR 70%

DreamDrive: Generative 4D Scene Modeling from Street View Images

Jiageng Mao, Boyi Li, Boris Ivanovic, Yuxiao Chen, Yan Wang, Yurong You, Chaowei Xiao, Danfei Xu, Marco Pavone, Yue Wang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://pointscoder.github.io/DreamDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00103 2025-01-03 cs.CV 70%

LTX-Video: Realtime Video Latent Diffusion

Yoav HaCohen, Nisan Chiprut, Benny Brazowski, Daniel Shalem, Dudu Moshe, Eitan Richardson, Eran Levin, Guy Shiran, Nir Zabari, Ori Gordon, Poriya Panet, Sapir Weissbuch, Victor Kulikov, Yaki Bitterman, Zeev Melumian, Ofir Bibi

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18607 2024-12-25 cs.CV 70%

DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers

Yuntao Chen, Yuqi Wang, Zhaoxiang Zhang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04000 2024-12-11 cs.CV 70%

IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation

Sejong Yang, Seoung Wug Oh, Yang Zhou, Seon Joo Kim

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Underreview

详情

展开后加载摘要…

URL PDF HTML 收藏