arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2511.18922 2025-11-25 cs.CV 70%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12089 2025-11-19 cs.CV 70%

Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback

Xingpei Ma, Shenneng Huang, Jiaran Cai, Yuansheng Guan, Shen Zheng, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang

机构 * Project lead & Corresponding Author(项目负责人及通讯作者)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12241 2025-11-18 cs.AI cs.CV 70%

AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos

Junhyuk Seo, Hyeyoon Moon, Kyu-Hwan Jung, Namkee Oh, Taerim Kim

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11062 2025-11-17 cs.CV cs.AI 70%

LiteAttention: A Temporal Sparse Attention for Diffusion Transformers

Dor Shmilovich, Tony Wu, Aviad Dahan, Yuval Domb

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27169 2025-11-03 cs.CV 70%

DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model

Yucheng Xing, Jinxing Yin, Xiaodong Liu

机构 * Stony Brook University(石溪大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08325 2025-10-31 cs.CV 70%

GameFactory: Creating New Games with Generative Interactive Videos

Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Highlight, Project Page: https://yujiwen.github.io/gamefactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03621 2025-10-21 cs.CV 70%

DynVFX: Augmenting Real Videos with Dynamic Content

Danah Yatim, Rafail Fridman, Omer Bar-Tal, Tali Dekel

机构 * Weizmann Institute of Science(魏兹曼科学研究所)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://dynvfx.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08530 2025-10-10 cs.GR cs.CV 70%

X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering

Zhitong Huang, Mohan Zhang, Renhan Wang, Rui Tang, Hao Zhu, Jing Liao

机构 * City University of Hong Kong(香港城市大学) WeChat, Tencent Inc(微信、腾讯公司) Manycore Tech Inc(很多核科技公司)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Code, model, and dataset will be released at project page soon: https://luckyhzt.github.io/x2video

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24353 2025-09-30 cs.CV 70%

NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis

Yixuan Ren, Hanyu Wang, Hao Chen, Bo He, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: https://nerv-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05827 2025-09-29 cs.CV 70%

Self-Guidance: Boosting Flow and Diffusion Generation on Their Own

Tiancheng Li, Weijian Luo, Zhiyang Chen, Liyuan Ma, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Peking University(北京大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究院先进技术研究所)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20251 2025-09-25 cs.CV 70%

4D Driving Scene Generation With Stereo Forcing

Hao Lu, Zhuang Ma, Guangfeng Jiang, Wenhang Ge, Bohan Li, Yuzhan Cai, Wenzhao Zheng, Yunpeng Zhang, Yingcong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10312 2025-09-15 cs.CV 70%

Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching

Zhixin Zheng, Xinyu Wang, Chang Zou, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Shandong University(山东大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 11 pages, 11 figures; Accepted by ACM MM2025; Mainly focus on feature caching for diffusion transformers acceleration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07472 2025-09-10 cs.CV 70%

ANYPORTAL: Zero-Shot Consistent Video Background Replacement

Wenshuo Gao, Xicheng Lan, Shuai Yang

机构 * Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(王轩计算机技术研究所,多媒体信息处理国家重点实验室,北京大学,北京)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 8 pages, ICCV 2025, Website: https://gaowenshuo.github.io/AnyPortal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07961 2025-08-20 cs.CV 70%

Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction

Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

Comments 17 pages, 6 figures, ICCV 2025 Highlight, Project page: https://geo4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08086 2025-08-12 cs.CV cs.GR 70%

Matrix-3D: Omnidirectional Explorable 3D World Generation

Zhongqi Yang, Wenhang Ge, Yuqi Li, Jiaqi Chen, Haoyuan Li, Mengyin An, Fei Kang, Hua Xue, Baixin Xu, Yuyang Yin, Eric Li, Yang Liu, Yikai Wang, Hao-Xiang Guo, Yahui Zhou

机构 * Skywork AI Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23287 2025-08-08 cs.CV 70%

ReferEverything: Towards Segmenting Everything We Can Speak of in Videos

Anurag Bagchi, Zhipeng Bao, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究 institute)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page at https://refereverything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17744 2025-07-24 cs.CV cs.AI cs.HC 70%

Yume: An Interactive World Generation Model

Xiaofeng Mao, Shaoheng Lin, Zhen Li, Chuanhao Li, Wenshuo Peng, Tong He, Jiangmiao Pang, Mingmin Chi, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08676 2025-07-22 cs.CV cs.GR 70%

FlexiClip: Locality-Preserving Free-Form Character Animation

Anant Khandelwal

机构 * Search Technology Center India, Microsoft, IDC, Bengaluru, India(Bharat)(印度搜索技术中心、微软、IDC、班加罗尔、印度(巴哈拉特))

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 13 pages, 4 figures, 7 tables, Accepted in ICML 2025, https://openreview.net/forum?id=xtxCM4XZ82

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11167 2025-07-17 cs.CV cs.AI 70%

Neurons: Emulating the Human Visual Cortex Improves Fidelity and Interpretability in fMRI-to-Video Reconstruction

Haonan Wang, Qixiang Zhang, Lehan Wang, Xuanqi Huang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04720 2025-07-11 cs.CV 70%

FluidNexus: 3D Fluid Reconstruction and Prediction from a Single Video

Yue Gao, Hong-Xing Yu, Bo Zhu, Jiajun Wu

机构 * Stanford University(斯坦福大学) Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments CVPR 2025 (oral). The first two authors contributed equally. Project website: https://yuegao.me/FluidNexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24113 2025-07-01 cs.CV 70%

Epona: Autoregressive Diffusion World Model for Autonomous Driving

Kaiwen Zhang, Zhenyu Tang, Xiaotao Hu, Xingang Pan, Xiaoyang Guo, Yuan Liu, Jingwei Huang, Li Yuan, Qian Zhang, Xiao-Xiao Long, Xun Cao, Wei Yin

机构 * Horizon Robotics Tsinghua University(清华大学) Peking University(北京大学) Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文心)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV2025, Project Page: https://kevin-thu.github.io/Epona/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10494 2025-06-11 cs.CV cs.AI cs.LG cs.PF 70%

SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device

Yushu Wu, Zhixing Zhang, Yanyu Li, Yanwu Xu, Anil Kag, Yang Sui, Huseyin Coskun, Ke Ma, Aleksei Lebedev, Ju Hu, Dimitris Metaxas, Yanzhi Wang, Sergey Tulyakov, Jian Ren

机构 * Snap Inc. Northeastern University(东北大学) Rutgers University(罗格斯大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments https://snap-research.github.io/snapgen-v/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01546 2025-06-03 cs.CV 70%

LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model

Xiaodong Wang, Zhirong Wu, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments project homepage: https://wang-xiaodong1899.github.io/longdwm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19911 2025-05-08 cs.CV 70%

Replace Anyone in Videos

Xiang Wang, Shiwei Zhang, Haonan Qiu, Ruihang Chu, Zekun Li, Yingya Zhang, Changxin Gao, Yuehuan Wang, Chunhua Shen, Nong Sang

机构 * Key Laboratory of Ministry of Education for Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11934 2025-04-29 cs.CV cs.AI 70%

SpatialDreamer: Self-supervised Stereo Video Synthesis from Monocular Input

Zhen Lv, Yangqi Long, Congzhentao Huang, Cao Li, Chengfei Lv, Hao Ren, Dian Zheng

机构 * Alibaba Group(阿里巴巴集团) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments website, see https://spatialdreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11389 2025-04-21 cs.GR cs.AI cs.CV 70%

VideoPanda: Video Panoramic Diffusion with Multi-view Attention

Kevin Xie, Amirmojtaba Sabour, Jiahui Huang, Despoina Paschalidou, Greg Klar, Umar Iqbal, Sanja Fidler, Xiaohui Zeng

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project website at https://research.nvidia.com/labs/toronto-ai/VideoPanda/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17934 2025-03-25 cs.CV 70%

TransAnimate: Taming Layer Diffusion to Generate RGBA Video

Xuewei Chen, Zhimin Chen, Yiren Song

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06674 2025-03-13 cs.CV 70%

Learning Few-Step Diffusion Models by Trajectory Distribution Matching

Yihong Luo, Tianyang Hu, Jiacheng Sun, Yujun Cai, Jing Tang

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://tdm-t2x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08665 2025-03-12 cs.CV cs.AI cs.LG 70%

REGEN: Learning Compact Video Embedding with (Re-)Generative Decoder

Yitian Zhang, Long Mai, Aniruddha Mahapatra, David Bourgin, Yicong Hong, Jonah Casebeer, Feng Liu, Yun Fu

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07659 2025-03-12 cs.CV 70%

MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion

Onkar Susladkar, Jishu Sen Gupta, Chirag Sehgal, Sparsh Mittal, Rekha Singhal

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted in ICLR 2025 (spotlight paper)

详情

展开后加载摘要…

URL PDF HTML 收藏