arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2412.01987 2025-03-26 cs.CV 57%

ShowHowTo: Generating Scene-Conditioned Step-by-Step Visual Instructions

Tomáš Souček, Prajwal Gatti, Michael Wray, Ivan Laptev, Dima Damen, Josef Sivic

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16683 2025-03-25 cs.CV 57%

Generative Omnimatte: Learning to Decompose Video into Layers

Yao-Chih Lee, Erika Lu, Sarah Rumbley, Michal Geyer, Jia-Bin Huang, Tali Dekel, Forrester Cole

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://gen-omnimatte.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08295 2025-03-25 cs.CV 57%

LayerAnimate: Layer-level Control for Animation

Yuxue Yang, Lue Fan, Zuzeng Lin, Feng Wang, Zhaoxiang Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://layeranimate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01320 2025-03-25 cs.CV 57%

SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration

Jianyi Wang, Zhijie Lin, Meng Wei, Yang Zhao, Ceyuan Yang, Fei Xiao, Chen Change Loy, Lu Jiang

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments CVPR25 CR ver., add a co-author additionally. Project page: https://iceclear.github.io/projects/seedvr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07001 2025-03-21 cs.CV cs.AI cs.LG 57%

From Image to Video: An Empirical Study of Diffusion Representations

Pedro Vélez, Luisa F. Polanía, Yi Yang, Chuhan Zhang, Rishabh Kabra, Anurag Arnab, Mehdi S. M. Sajjadi

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12964 2025-03-18 cs.CV cs.AI cs.LG 57%

Training Video Foundation Models with NVIDIA NeMo

Zeeshan Patel, Ethan He, Parth Mannan, Xiaowei Ren, Ryan Wolf, Niket Agarwal, Jacob Huffman, Zhuoyao Wang, Carl Wang, Jack Chang, Yan Bai, Tommy Huang, Linnan Wang, Sahil Jain, Shanmugam Ramasamy, Joseph Jennings, Ekaterina Sirazitdinova, Oleg Sudakov, Mingyuan Ma, Bobby Chen, Forrest Lin, Hao Wang, Vasanth Rao Naik Sabavat, Sriharsha Niverty, Rong Ou, Pallab Bhattacharya, David Page, Nima Tajbakhsh, Ashwath Aithal

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12531 2025-03-18 cs.CV 57%

Towards Suturing World Models: Learning Predictive Models for Robotic Surgical Tasks

Mehmet Kerem Turkcan, Mattia Ballo, Filippo Filicori, Zoran Kostic

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12102 2025-03-18 cs.CV 57%

A Speech-to-Video Synthesis Approach Using Spatio-Temporal Diffusion for Vocal Tract MRI

Paula Andrea Pérez-Toro, Tomás Arias-Vergara, Fangxu Xing, Xiaofeng Liu, Maureen Stone, Jiachen Zhuo, Juan Rafael Orozco-Arroyave, Elmar Nöth, Jana Hutter, Jerry L. Prince, Andreas Maier, Jonghye Woo

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19189 2025-03-18 cs.CV 57%

Video Depth without Video Models

Bingxin Ke, Dominik Narnhofer, Shengyu Huang, Lei Ke, Torben Peters, Katerina Fragkiadaki, Anton Obukhov, Konrad Schindler

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Project page: rollingdepth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05954 2025-03-18 cs.CV cs.LG 57%

Pyramidal Flow Matching for Efficient Video Generative Modeling

Yang Jin, Zhicheng Sun, Ningyuan Li, Kun Xu, Kun Xu, Hao Jiang, Nan Zhuang, Quzhe Huang, Yang Song, Yadong Mu, Zhouchen Lin

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10604 2025-03-14 cs.CV 57%

MuDG: Taming Multi-modal Diffusion with Gaussian Splatting for Urban Scene Reconstruction

Yingshuang Zou, Yikang Ding, Chuanrui Zhang, Jiazhe Guo, Bohan Li, Xiaoyang Lyu, Feiyang Tan, Xiaojuan Qi, Haoqian Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04824 2025-03-13 cs.GR cs.AI cs.CV 57%

ProReflow: Progressive Reflow with Decomposed Velocity

Lei Ke, Haohang Xu, Xuefei Ning, Yu Li, Jiajun Li, Haoling Li, Yuxuan Lin, Dongsheng Jiang, Yujiu Yang, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Our codes will be released at Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10815 2025-03-13 cs.CV cs.AI 57%

Depth Any Video with Scalable Synthetic Data

Honghui Yang, Di Huang, Wei Yin, Chunhua Shen, Haifeng Liu, Xiaofei He, Binbin Lin, Wanli Ouyang, Tong He

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://depthanyvideo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08729 2025-03-13 cs.CV cs.AI cs.LG 57%

Preserving Product Fidelity in Large Scale Image Recontextualization with Diffusion Models

Ishaan Malhi, Praneet Dutta, Ellie Talius, Sally Ma, Brendan Driscoll, Krista Holden, Garima Pruthi, Arunachalam Narayanaswamy

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21044 2025-03-11 cs.CV 57%

E2ED^2:Direct Mapping from Noise to Data for Enhanced Diffusion Models

Zhiyu Tan, WenXu Qian, Hesen Chen, Mengping Yang, Lei Chen, Hao Li

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05978 2025-03-11 cs.CV 57%

MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice

Hongwei Yi, Tian Ye, Shitong Shao, Xuancheng Yang, Jiantong Zhao, Hanzhong Guo, Terrance Wang, Qingyu Yin, Zeke Xie, Lei Zhu, Wei Li, Michael Lingelbach, Daquan Zhou

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments MagicInfinite is publicly accessible at https://www.hedra.com/. More examples are at https://magicinfinite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05638 2025-03-10 cs.CV cs.AI cs.GR 57%

TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models

Mark YU, Wenbo Hu, Jinbo Xing, Ying Shan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://trajectorycrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19233 2025-03-10 cs.CV 57%

Gaussians-to-Life: Text-Driven Animation of 3D Gaussian Splatting Scenes

Thomas Wimmer, Michael Oechsle, Michael Niemeyer, Federico Tombari

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project website at https://wimmerth.github.io/gaussians2life.html. Accepted to 3DV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20126 2025-02-28 cs.LG cs.CV 57%

FlexiDiT: Your Diffusion Transformer Can Easily Generate High-Quality Samples with Less Compute

Sotiris Anagnostidis, Gregor Bachmann, Yeongmin Kim, Jonas Kohler, Markos Georgopoulos, Artsiom Sanakoyeu, Yuming Du, Albert Pumarola, Ali Thabet, Edgar Schönfeld

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02574 2025-02-28 cs.CV cs.AI stat.ML 57%

Solving Video Inverse Problems Using Image Diffusion Models

Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025; 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14994 2025-02-24 cs.CV 57%

LAVID: An Agentic LVLM Framework for Diffusion-Generated Video Detection

Qingyuan Liu, Yun-Yun Tsai, Ruijian Zha, Victoria Li, Pengyuan Shi, Chengzhi Mao, Junfeng Yang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05317 2025-02-20 cs.LG cs.AI cs.CV 57%

Accelerating Diffusion Transformers with Token-wise Feature Caching

Chang Zou, Xuyang Liu, Ting Liu, Siteng Huang, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ToCa is honored to be accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12752 2025-02-19 cs.CV 57%

High-Fidelity Novel View Synthesis via Splatting-Guided Diffusion

Xiang Zhang, Yang Zhang, Lukas Mehl, Markus Gross, Christopher Schroers

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11697 2025-02-18 cs.CV 57%

MVTokenFlow: High-quality 4D Content Generation using Multiview Token Flow

Hanzhuo Huang, Yuan Liu, Ge Zheng, Jiepeng Wang, Zhiyang Dou, Sibei Yang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025. Project page: https://soolab.github.io/MVTokenFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19331 2025-02-03 cs.CV 57%

Consistent Video Colorization via Palette Guidance

Han Wang, Yuang Zhang, Yuhong Zhang, Lingxiao Lu, Li Song

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18982 2025-02-03 cs.CV 57%

OmniPhysGS: 3D Constitutive Gaussians for General Physics-Based Dynamics Generation

Yuchen Lin, Chenguo Lin, Jianjin Xu, Yadong Mu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025; Project page: https://wgsxm.github.io/projects/omniphysgs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14173 2025-01-31 cs.CV 57%

AniDoc: Animation Creation Made Easier

Yihao Meng, Hao Ouyang, Hanlin Wang, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Zhiheng Liu, Yujun Shen, Huamin Qu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page and code: https://yihao-meng.github.io/AniDoc_demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15368 2025-01-24 cs.CV 57%

Flow-Guided Diffusion for Video Inpainting

Bohai Gu, Yongsheng Yu, Heng Fan, Libo Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments This paper has been withdrawn as a new iteration of the work has been developed, which includes significant improvements and refinements based on this submission. The withdrawal is made to ensure academic integrity and compliance with publication standards. If you are interested, please refer to the updated work at arXiv:2412.00857

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03374 2025-01-08 cs.CV cs.AI cs.LG 57%

License Plate Images Generation with Diffusion Models

Mariia Shpir, Nadiya Shvai, Amir Nakib

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Journal ref Frontiers in Artificial Intelligence and Applications, Vol. 392, 2024, pp. 4594-4601

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13144 2025-01-03 cs.LG cs.CV 57%

Neural Network Diffusion

Kai Wang, Dongwen Tang, Boya Zeng, Yida Yin, Zhaopan Xu, Yukun Zhou, Zelin Zang, Trevor Darrell, Zhuang Liu, Yang You

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments We introduce a novel approach for parameter generation, named neural network parameter diffusion (\textbf{p-diff}), which employs a standard latent diffusion model to synthesize a new set of parameters

详情

展开后加载摘要…

URL PDF HTML 收藏