arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2504.15661 2025-05-20 cs.CV 57%

DiTPainter: Efficient Video Inpainting with Diffusion Transformers

Xian Wu, Chang Liu

机构 * ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11825 2025-05-20 cs.CV cs.AI 57%

Bootstrapping Diffusion: Diffusion Model Training Leveraging Partial and Corrupted Data

Xudong Ma

机构 * San Francisco, California(旧金山,加利福尼亚)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21246 2025-05-20 cs.CV 57%

DynamiCtrl: Rethinking the Basic Structure and the Role of Text for High-quality Human Image Animation

Haoyu Zhao, Zhongang Qi, Cong Wang, Qingping Zheng, Guansong Lu, Fei Chen, Hang Xu, Zuxuan Wu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11245 2025-05-19 cs.CV 57%

Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models

Fu-Yun Wang, Yunhao Shui, Jingtan Piao, Keqiang Sun, Hongsheng Li

机构 * MMLab, CUHK, Hong Kong(CUHK的MMLab, 香港) Shanghai Jiang Tong University, Shanghai(上海江 Tong大学, 上海) CPII under InnoHK, Hong Kong(InnoHK下的CPII, 香港)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03562 2025-05-07 cs.CV cs.AI 57%

Real-Time Person Image Synthesis Using a Flow Matching Model

Jiwoo Jeong, Kirok Kim, Wooju Kim, Nam-Joon Kim

机构 * Department of Industrial Engineering, Yonsei University(延世大学工业工程系) Next-Generation Semiconductor, Seoul National University(首尔国立大学下一代半导体研究所)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14803 2025-05-06 cs.CV cs.RO 57%

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations

Yucheng Hu, Yanjiang Guo, Pengchao Wang, Xiaoyu Chen, Yen-Jen Wang, Jianke Zhang, Koushil Sreenath, Chaochao Lu, Jianyu Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICML 2025 Spotlight Paper. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12091 2025-04-29 cs.CV 57%

Wonderland: Navigating 3D Scenes from a Single Image

Hanwen Liang, Junli Cao, Vidit Goel, Guocheng Qian, Sergei Korolev, Demetri Terzopoulos, Konstantinos N. Plataniotis, Sergey Tulyakov, Jian Ren

机构 * University of Toronto(多伦多大学) Snap Inc.(Snap公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://snap-research.github.io/wonderland/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15786 2025-04-23 cs.CV 57%

Satellite to GroundScape -- Large-scale Consistent Ground View Generation from Satellite Views

Ningli Xu, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11732 2025-04-17 cs.CV 57%

EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos

Jilan Xu, Yifei Huang, Baoqi Pei, Junlin Hou, Qingqiu Li, Guo Chen, Yuejie Zhang, Rui Feng, Weidi Xie

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11143 2025-04-16 cs.CV 57%

Taming Consistency Distillation for Accelerated Human Image Animation

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Yujie Wei, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08296 2025-04-14 cs.CV 57%

Generative AI for Film Creation: A Survey of Recent Advances

Ruihan Zhang, Borou Yu, Jiajian Min, Yetong Xin, Zheng Wei, Juncheng Nemo Shi, Mingzhen Huang, Xianghao Kong, Nix Liu Xin, Shanshan Jiang, Praagya Bahuguna, Mark Chan, Khushi Hora, Lijian Yang, Yongqi Liang, Runhe Bian, Yunlei Liu, Isabela Campillo Valencia, Patricia Morales Tredinick, Ilia Kozlov, Sijia Jiang, Peiwen Huang, Na Chen, Xuanxuan Liu, Anyi Rao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted at CVPR 2025 CVEU workshop: AI for Creative Visual Content Generation Editing and Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16938 2025-04-14 cs.CV cs.AI cs.GR 57%

Generative Object Insertion in Gaussian Splatting with a Multi-View Diffusion Model

Hongliang Zhong, Can Wang, Jingbo Zhang, Jing Liao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by Visual Informatics. Project Page: https://github.com/JiuTongBro/MultiView_Inpaint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02659 2025-04-09 q-bio.NC cs.AI cs.CV 57%

Reanimating Images using Neural Representations of Dynamic Stimuli

Jacob Yeung, Andrew F. Luo, Gabriel Sarch, Margaret M. Henderson, Deva Ramanan, Michael J. Tarr

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://brain-nrds.github.io

Journal ref CVPR 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01876 2025-04-08 cs.CV cs.AI 57%

CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention

Gaojie Lin, Jianwen Jiang, Chao Liang, Tianyun Zhong, Jiaqi Yang, Yanbo Zheng

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICLR 2025 (Oral), Homepage: https://cyberhost.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03072 2025-04-07 cs.CV cs.LG 57%

How I Warped Your Noise: a Temporally-Correlated Noise Prior for Diffusion Models

Pascal Chang, Jingwei Tang, Markus Gross, Vinicius C. Azevedo

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted at ICLR 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18886 2025-04-04 cs.CV 57%

CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching Models

Weichen Fan, Amber Yijia Zheng, Raymond A. Yeh, Ziwei Liu

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://weichenfan.github.io/webpage-cfg-zero-star/ Github: https://github.com/WeichenFan/CFG-Zero-star

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06633 2025-04-03 cs.CV 57%

SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation

Teng Hu, Jiangning Zhang, Ran Yi, Hongrui Huang, Yabiao Wang, Lizhuang Ma

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01016 2025-04-02 cs.GR cs.AI cs.CV 57%

GeometryCrafter: Consistent Geometry Estimation for Open-world Videos with Diffusion Priors

Tian-Xing Xu, Xiangjun Gao, Wenbo Hu, Xiaoyu Li, Song-Hai Zhang, Ying Shan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://geometrycrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11044 2025-04-02 cs.CV 57%

PSF-4D: A Progressive Sampling Framework for View Consistent 4D Editing

Hasan Iqbal, Nazmul Karim, Umar Khalid, Azib Farooq, Zichun Zhong, Chen Chen, Jing Hua

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05979 2025-04-02 cs.CV 57%

VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer

Xinyu Liu, Ailing Zeng, Wei Xue, Harry Yang, Wenhan Luo, Qifeng Liu, Yike Guo

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23881 2025-04-01 cs.CV 57%

ExScene: Free-View 3D Scene Reconstruction with Gaussian Splatting from a Single Image

Tianyi Gong, Boyan Li, Yifei Zhong, Fangxin Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13319 2025-04-01 cs.CV 57%

MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis

Shitong Shao, Hongwei Yi, Hanzhong Guo, Tian Ye, Daquan Zhou, Michael Lingelbach, Zhiqiang Xu, Zeke Xie

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21219 2025-04-01 cs.CV cs.AI 57%

GenFusion: Closing the Loop between Reconstruction and Generation via Videos

Sibo Wu, Congrong Xu, Binbin Huang, Andreas Geiger, Anpei Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments CVPR 2025, project page: https://genfusion.sibowu.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18940 2025-03-28 cs.CV 57%

Training-free Diffusion Acceleration with Bottleneck Sampling

Ye Tian, Xin Xia, Yuxi Ren, Shanchuan Lin, Xing Wang, Xuefeng Xiao, Yunhai Tong, Ling Yang, Bin Cui

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project Page: https://tyfeld.github.io/BottleneckSampling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03708 2025-03-28 cs.CV cs.AI 57%

Rethinking Video Tokenization: A Conditioned Diffusion-based Approach

Nianzu Yang, Pandeng Li, Liming Zhao, Yang Li, Chen-Wei Xie, Yehui Tang, Xudong Lu, Zhihang Liu, Yun Zheng, Yu Liu, Junchi Yan

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20785 2025-03-27 cs.CV 57%

Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency

Tianqi Liu, Zihao Huang, Zhaoxi Chen, Guangcong Wang, Shoukang Hu, Liao Shen, Huiqiang Sun, Zhiguo Cao, Wei Li, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://free4d.github.io/ , Code: https://github.com/TQTQliu/Free4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16550 2025-03-27 cs.GR cs.CV 57%

PhysAnimator: Physics-Guided Generative Cartoon Animation

Tianyi Xie, Yiwei Zhao, Ying Jiang, Chenfanfu Jiang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19913 2025-03-26 cs.CV 57%

PartRM: Modeling Part-Level Dynamics with Large Cross-State Reconstruction Model

Mingju Gao, Yike Pan, Huan-ang Gao, Zongzheng Zhang, Wenyi Li, Hao Dong, Hao Tang, Li Yi, Hao Zhao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project Page: https://partrm.c7w.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18860 2025-03-26 cs.CV 57%

HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation

Zunnan Xu, Zhentao Yu, Zixiang Zhou, Jun Zhou, Xiaoyu Jin, Fa-Ting Hong, Xiaozhong Ji, Junwei Zhu, Chengfei Cai, Shiyu Tang, Qin Lin, Xiu Li, Qinglin Lu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16942 2025-03-26 cs.CV 57%

Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model

Yingying Fan, Quanwei Yang, Kaisiyuan Wang, Hang Zhou, Yingying Li, Haocheng Feng, Errui Ding, Yu Wu, Jingdong Wang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏