arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2506.05934 2025-06-09 cs.CV cs.AI 57%

FADE: Frequency-Aware Diffusion Model Factorization for Video Editing

Yixuan Zhu, Haolin Wang, Shilin Ma, Wenliang Zhao, Yansong Tang, Lei Chen, Jie Zhou

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03275 2025-06-05 cs.CV cs.AI 57%

Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas

Austin Silveria, Soham V. Govande, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01014 2025-06-02 cs.CV 57%

AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction

Junhao Cheng, Yuying Ge, Yixiao Ge, Jing Liao, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22167 2025-05-29 cs.CV 57%

Q-VDiT: Towards Accurate Quantization and Distillation of Video-Generation Diffusion Transformers

Weilun Feng, Chuanguang Yang, Haotong Qin, Xiangqi Li, Yu Wang, Zhulin An, Libo Huang, Boyu Diao, Zixiang Zhao, Yongjun Xu, Michele Magno

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted to ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20422 2025-05-28 cs.CV 57%

Bringing Objects to Life: training-free 4D generation from 3D objects through view consistent noise

Ohad Rahamim, Ori Malca, Dvir Samuel, Gal Chechik

机构 * Bar-Ilan University(巴伊兰大学) NVIDIA(英伟达)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20171 2025-05-27 cs.CV 57%

Long-Context State-Space Video World Models

Ryan Po, Yotam Nitzan, Richard Zhang, Berlin Chen, Tri Dao, Eli Shechtman, Gordon Wetzstein, Xun Huang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project website: https://ryanpo.com/ssm_wm

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12489 2025-05-22 cs.CV cs.AI 57%

Video-GPT via Next Clip Diffusion

Shaobin Zhuang, Zhipeng Huang, Ying Zhang, Fangyikang Wang, Canmiao Fu, Binxin Yang, Chong Sun, Chen Li, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Zhejiang University(浙江大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Shanghai AI Laboratory(深圳先进技术研究院、中国科学院上海人工智能实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 22 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14687 2025-05-21 cs.CV 57%

Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers

Sucheng Ren, Qihang Yu, Ju He, Alan Yuille, Liang-Chieh Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project website at oliverrensu.github.io/project/GRAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15661 2025-05-20 cs.CV 57%

DiTPainter: Efficient Video Inpainting with Diffusion Transformers

Xian Wu, Chang Liu

机构 * ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11825 2025-05-20 cs.CV cs.AI 57%

Bootstrapping Diffusion: Diffusion Model Training Leveraging Partial and Corrupted Data

Xudong Ma

机构 * San Francisco, California(旧金山,加利福尼亚)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21246 2025-05-20 cs.CV 57%

DynamiCtrl: Rethinking the Basic Structure and the Role of Text for High-quality Human Image Animation

Haoyu Zhao, Zhongang Qi, Cong Wang, Qingping Zheng, Guansong Lu, Fei Chen, Hang Xu, Zuxuan Wu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11245 2025-05-19 cs.CV 57%

Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models

Fu-Yun Wang, Yunhao Shui, Jingtan Piao, Keqiang Sun, Hongsheng Li

机构 * MMLab, CUHK, Hong Kong(CUHK的MMLab, 香港) Shanghai Jiang Tong University, Shanghai(上海江 Tong大学, 上海) CPII under InnoHK, Hong Kong(InnoHK下的CPII, 香港)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03562 2025-05-07 cs.CV cs.AI 57%

Real-Time Person Image Synthesis Using a Flow Matching Model

Jiwoo Jeong, Kirok Kim, Wooju Kim, Nam-Joon Kim

机构 * Department of Industrial Engineering, Yonsei University(延世大学工业工程系) Next-Generation Semiconductor, Seoul National University(首尔国立大学下一代半导体研究所)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14803 2025-05-06 cs.CV cs.RO 57%

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, Jianyu Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICML 2025 Spotlight Paper. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12091 2025-04-29 cs.CV 57%

Wonderland: Navigating 3D Scenes from a Single Image

Hanwen Liang, Junli Cao, Vidit Goel, Guocheng Qian, Sergei Korolev, Demetri Terzopoulos, Konstantinos N. Plataniotis, Sergey Tulyakov, Jian Ren

机构 * University of Toronto(多伦多大学) Snap Inc.(Snap公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://snap-research.github.io/wonderland/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15786 2025-04-23 cs.CV 57%

Satellite to GroundScape -- Large-scale Consistent Ground View Generation from Satellite Views

Ningli Xu, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11732 2025-04-17 cs.CV 57%

EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos

Jilan Xu, Yifei Huang, Baoqi Pei, Junlin Hou, Qingqiu Li, Guo Chen, Yuejie Zhang, Rui Feng, Weidi Xie

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11143 2025-04-16 cs.CV 57%

Taming Consistency Distillation for Accelerated Human Image Animation

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Yujie Wei, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08296 2025-04-14 cs.CV 57%

Generative AI for Film Creation: A Survey of Recent Advances

Ruihan Zhang, Borou Yu, Jiajian Min, Yetong Xin, Zheng Wei, Juncheng Nemo Shi, Mingzhen Huang, Xianghao Kong, Nix Liu Xin, Shanshan Jiang, Praagya Bahuguna, Mark Chan, Khushi Hora, Lijian Yang, Yongqi Liang, Runhe Bian, Yunlei Liu, Isabela Campillo Valencia, Patricia Morales Tredinick, Ilia Kozlov, Sijia Jiang, Peiwen Huang, Na Chen, Xuanxuan Liu, Anyi Rao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025 CVEU workshop: AI for Creative Visual Content Generation Editing and Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16938 2025-04-14 cs.CV cs.AI cs.GR 57%

Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model

Hongliang Zhong, Can Wang, Jingbo Zhang, Jing Liao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by Visual Informatics. Project Page: https://github.com/JiuTongBro/MultiView_Inpaint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02659 2025-04-09 q-bio.NC cs.AI cs.CV 57%

Reanimating Images using Neural Representations of Dynamic Stimuli

Jacob Yeung, Andrew F. Luo, Gabriel Sarch, Margaret M. Henderson, Deva Ramanan, Michael J. Tarr

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://brain-nrds.github.io

Journal ref CVPR 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01876 2025-04-08 cs.CV cs.AI 57%

CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention

Gaojie Lin, Jianwen Jiang, Chao Liang, Tianyun Zhong, Jiaqi Yang, Yanbo Zheng

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICLR 2025 (Oral), Homepage: https://cyberhost.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03072 2025-04-07 cs.CV cs.LG 57%

How I Warped Your Noise: a Temporally-Correlated Noise Prior for Diffusion Models

Pascal Chang, Jingwei Tang, Markus Gross, Vinicius C. Azevedo

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted at ICLR 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18886 2025-04-04 cs.CV 57%

CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching Models

Weichen Fan, Amber Yijia Zheng, Raymond A. Yeh, Ziwei Liu

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://weichenfan.github.io/webpage-cfg-zero-star/ Github: https://github.com/WeichenFan/CFG-Zero-star

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06633 2025-04-03 cs.CV 57%

SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation

Teng Hu, Jiangning Zhang, Ran Yi, Hongrui Huang, Yabiao Wang, Lizhuang Ma

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01016 2025-04-02 cs.GR cs.AI cs.CV 57%

GeometryCrafter: Consistent Geometry Estimation for Open-world Videos with Diffusion Priors

Tian-Xing Xu, Xiangjun Gao, Wenbo Hu, Xiaoyu Li, Song-Hai Zhang, Ying Shan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://geometrycrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11044 2025-04-02 cs.CV 57%

PSF-4D: A Progressive Sampling Framework for View Consistent 4D Editing

Hasan Iqbal, Nazmul Karim, Umar Khalid, Azib Farooq, Zichun Zhong, Chen Chen, Jing Hua

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05979 2025-04-02 cs.CV 57%

VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer

Xinyu Liu, Ailing Zeng, Wei Xue, Harry Yang, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23881 2025-04-01 cs.CV 57%

ExScene: Free-View 3D Scene Reconstruction with Gaussian Splatting from a Single Image

Tianyi Gong, Boyan Li, Yifei Zhong, Fangxin Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13319 2025-04-01 cs.CV 57%

MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis

Shitong Shao, Hongwei Yi, Hanzhong Guo, Tian Ye, Daquan Zhou, Michael Lingelbach, Zhiqiang Xu, Zeke Xie

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏