arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2503.21219 2025-04-01 cs.CV cs.AI 57%

GenFusion: Closing the Loop between Reconstruction and Generation via Videos

Sibo Wu, Congrong Xu, Binbin Huang, Andreas Geiger, Anpei Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025, project page: https://genfusion.sibowu.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18940 2025-03-28 cs.CV 57%

Training-free Diffusion Acceleration with Bottleneck Sampling

Ye Tian, Xin Xia, Yuxi Ren, Shanchuan Lin, Xing Wang, Xuefeng Xiao, Yunhai Tong, Ling Yang, Bin Cui

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project Page: https://tyfeld.github.io/BottleneckSampling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03708 2025-03-28 cs.CV cs.AI 57%

Rethinking Video Tokenization: A Conditioned Diffusion-based Approach

Nianzu Yang, Pandeng Li, Liming Zhao, Yang Li, Chen-Wei Xie, Yehui Tang, Xudong Lu, Zhihang Liu, Yun Zheng, Yu Liu, Junchi Yan

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20785 2025-03-27 cs.CV 57%

Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency

Tianqi Liu, Zihao Huang, Zhaoxi Chen, Guangcong Wang, Shoukang Hu, Liao Shen, Huiqiang Sun, Zhiguo Cao, Wei Li, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://free4d.github.io/ , Code: https://github.com/TQTQliu/Free4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16550 2025-03-27 cs.GR cs.CV 57%

PhysAnimator: Physics-Guided Generative Cartoon Animation

Tianyi Xie, Yiwei Zhao, Ying Jiang, Chenfanfu Jiang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19913 2025-03-26 cs.CV 57%

PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model

Mingju Gao, Yike Pan, Huan-ang Gao, Zongzheng Zhang, Wenyi Li, Hao Dong, Hao Tang, Li Yi, Hao Zhao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project Page: https://partrm.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18860 2025-03-26 cs.CV 57%

HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation

Zunnan Xu, Zhentao Yu, Zixiang Zhou, Jun Zhou, Xiaoyu Jin, Fa-Ting Hong, Xiaozhong Ji, Junwei Zhu, Chengfei Cai, Shiyu Tang, Qin Lin, Xiu Li, Qinglin Lu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16942 2025-03-26 cs.CV 57%

Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model

Yingying Fan, Quanwei Yang, Kaisiyuan Wang, Hang Zhou, Yingying Li, Haocheng Feng, Errui Ding, Yu Wu, Jingdong Wang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01987 2025-03-26 cs.CV 57%

ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions

Tomáš Souček, Prajwal Gatti, Michael Wray, Ivan Laptev, Dima Damen, Josef Sivic

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16683 2025-03-25 cs.CV 57%

Generative Omnimatte: Learning to Decompose Video into Layers

Yao-Chih Lee, Erika Lu, Sarah Rumbley, Michal Geyer, Jia-Bin Huang, Tali Dekel, Forrester Cole

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://gen-omnimatte.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08295 2025-03-25 cs.CV 57%

LayerAnimate: Layer-level Control for Animation

Yuxue Yang, Lue Fan, Zuzeng Lin, Feng Wang, Zhaoxiang Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://layeranimate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01320 2025-03-25 cs.CV 57%

SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration

Jianyi Wang, Zhijie Lin, Meng Wei, Yang Zhao, Ceyuan Yang, Fei Xiao, Chen Change Loy, Lu Jiang

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments CVPR25 CR ver., add a co-author additionally. Project page: https://iceclear.github.io/projects/seedvr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07001 2025-03-21 cs.CV cs.AI cs.LG 57%

From Image to Video: An Empirical Study of Diffusion Representations

Pedro Vélez, Luisa F. Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, Mehdi S. M. Sajjadi

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12964 2025-03-18 cs.CV cs.AI cs.LG 57%

Training Video Foundation Models with NVIDIA NeMo

Zeeshan Patel, Ethan He, Parth Mannan, Xiaowei Ren, Ryan Wolf, Niket Agarwal, Jacob Huffman, Zhuoyao Wang, Carl Wang, Jack Chang, Yan Bai, Tommy Huang, Linnan Wang, Sahil Jain, Shanmugam Ramasamy, Joseph Jennings, Ekaterina Sirazitdinova, Oleg Sudakov, Mingyuan Ma, Bobby Chen, Forrest Lin, Hao Wang, Vasanth Rao Naik Sabavat, Sriharsha Niverty, Rong Ou, Pallab Bhattacharya, David Page, Nima Tajbakhsh, Ashwath Aithal

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12531 2025-03-18 cs.CV 57%

Towards Suturing World Models: Learning Predictive Models for Robotic Surgical Tasks

Mehmet Kerem Turkcan, Mattia Ballo, Filippo Filicori, Zoran Kostic

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12102 2025-03-18 cs.CV 57%

A Speech-to-Video Synthesis Approach Using Spatio-Temporal Diffusion for Vocal Tract MRI

Paula Andrea Pérez-Toro, Tomás Arias-Vergara, Fangxu Xing, Xiaofeng Liu, Maureen Stone, Jiachen Zhuo, Juan Rafael Orozco-Arroyave, Elmar Nöth, Jana Hutter, Jerry L. Prince, Andreas Maier, Jonghye Woo

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19189 2025-03-18 cs.CV 57%

Video Depth without Video Models

Bingxin Ke, Dominik Narnhofer, Shengyu Huang, Lei Ke, Torben Peters, Katerina Fragkiadaki, Anton Obukhov, Konrad Schindler

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Project page: rollingdepth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05954 2025-03-18 cs.CV cs.LG 57%

Pyramidal Flow Matching for Efficient Video Generative Modeling

Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, Zhouchen Lin

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10604 2025-03-14 cs.CV 57%

MuDG: Taming Multi-modal Diffusion with Gaussian Splatting for Urban Scene Reconstruction

Yingshuang Zou, Yikang Ding, Chuanrui Zhang, Jiazhe Guo, Bohan Li, Xiaoyang Lyu, Feiyang Tan, Xiaojuan Qi, Haoqian Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04824 2025-03-13 cs.GR cs.AI cs.CV 57%

ProReflow: Progressive Reflow with Decomposed Velocity

Lei Ke, Haohang Xu, Xuefei Ning, Yu Li, Jiajun Li, Haoling Li, Yuxuan Lin, Dongsheng Jiang, Yujiu Yang, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Our codes will be released at Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10815 2025-03-13 cs.CV cs.AI 57%

Depth Any Video with Scalable Synthetic Data

Honghui Yang, Di Huang, Wei Yin, Chunhua Shen, Haifeng Liu, Xiaofei He, Binbin Lin, Wanli Ouyang, Tong He

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://depthanyvideo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08729 2025-03-13 cs.CV cs.AI cs.LG 57%

Preserving Product Fidelity in Large Scale Image Recontextualization with Diffusion Models

Ishaan Malhi, Praneet Dutta, Ellie Talius, Sally Ma, Brendan Driscoll, Krista Holden, Garima Pruthi, Arunachalam Narayanaswamy

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21044 2025-03-11 cs.CV 57%

E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models

Zhiyu Tan, WenXu Qian, Hesen Chen, Mengping Yang, Lei Chen, Hao Li

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05978 2025-03-11 cs.CV 57%

MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice

Hongwei Yi, Tian Ye, Shitong Shao, Xuancheng Yang, Jiantong Zhao, Hanzhong Guo, Terrance Wang, Qingyu Yin, Zeke Xie, Lei Zhu, Wei Li, Michael Lingelbach, Daquan Zhou

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments MagicInfinite is publicly accessible at https://www.hedra.com/. More examples are at https://magicinfinite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05638 2025-03-10 cs.CV cs.AI cs.GR 57%

TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models

Mark YU, Wenbo Hu, Jinbo Xing, Ying Shan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://trajectorycrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19233 2025-03-10 cs.CV 57%

Gaussians-to-Life: Text-Driven Animation of 3D Gaussian Splatting Scenes

Thomas Wimmer, Michael Oechsle, Michael Niemeyer, Federico Tombari

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project website at https://wimmerth.github.io/gaussians2life.html. Accepted to 3DV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20126 2025-02-28 cs.LG cs.CV 57%

FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute

Sotiris Anagnostidis, Gregor Bachmann, Yeongmin Kim, Jonas Kohler, Markos Georgopoulos, Artsiom Sanakoyeu, Yuming Du, Albert Pumarola, Ali Thabet, Edgar Schönfeld

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02574 2025-02-28 cs.CV cs.AI stat.ML 57%

Solving Video Inverse Problems Using Image Diffusion Models

Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025; 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14994 2025-02-24 cs.CV 57%

LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection

Qingyuan Liu, Yun-Yun Tsai, Ruijian Zha, Victoria Li, Pengyuan Shi, Chengzhi Mao, Junfeng Yang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05317 2025-02-20 cs.LG cs.AI cs.CV 57%

Accelerating Diffusion Transformers with Token-wise Feature Caching

Chang Zou, Xuyang Liu, Ting Liu, Siteng Huang, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ToCa is honored to be accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏