arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2601.07287 2026-01-13 cs.CV 74%

Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models

焦点引导:从语义弱层中解锁视频扩散模型的可控性

Yuanyang Yin, Yufan Deng, Shenghai Yuan, Kaipeng Zhang, Xiao Yang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance China(字节跳动中国)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 74%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07500 2025-12-15 cs.CV 74%

MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer

多主体视频动作迁移:通过视频扩散变换器实现

Penghui Liu, Jiangshan Wang, Yutong Shen, Shanhui Mo, Chenyang Qi, Yue Ma

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10687 2025-11-06 cs.CV 74%

Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation

Hao Zhang, Chun-Han Yao, Simon Donné, Narendra Ahuja, Varun Jampani

机构 * Stability AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Page: https://stablepartdiffusion4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09656 2025-10-17 cs.CV 74%

KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation

Xingrui Wang, Jiang Liu, Ze Wang, Xiaodong Yu, Jialian Wu, Ximeng Sun, Yusheng Su, Alan Yuille, Zicheng Liu, Emad Barsoum

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08632 2025-10-14 cs.CV 74%

RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Dong Chen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig-Maximilians-Universität München (LMU Munich)(慕尼黑路德维希-马克西米利安大学) Huawei Heisenberg Research Center(华为海森堡研究中心) Technische Universität München (TUM)(慕尼黑技术大学) Albert-Ludwigs-Universität Freiburg(弗赖堡阿尔伯特-路易斯-大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09212 2025-10-13 cs.CV 74%

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

Wuyang Li, Wentao Pan, Po-Chien Luan, Yang Gao, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: https://stable-video-infinity.github.io/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19690 2025-09-25 cs.CV 74%

From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition

Ling Lo, Kelvin C. K. Chan, Wen-Huang Cheng, Ming-Hsuan Yang

机构 * National Yang Ming Chiao Tung University(阳明交通大学) Google DeepMind(谷歌DeepMind) National Taiwan University(国立台湾大学) UC Merced(加州大学梅尔塞德斯分校)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10568 2025-08-28 cs.CV cs.AI 74%

DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers

Lizhen Wang, Zhurong Xia, Tianshu Hu, Pengrui Wang, Pengfei Wei, Zerong Zheng, Ming Zhou, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04147 2025-08-07 cs.CV 74%

IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control

Lijuan Liu, Wenfa Li, Dongbo Zhang, Shuo Wang, Shaohui Jiao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11706 2025-05-27 cs.CV 74%

AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration

Wenhao Sun, Rong-Cheng Tu, Jingyi Liao, Zhao Jin, Dacheng Tao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 18 pages, 14 figures. Accepted by ICML 2025. The code is available at https://github.com/wenhao728/AsymRnR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09858 2025-05-16 cs.CV 74%

Mission Balance: Generating Under-represented Class Samples using Video Diffusion Models

Danush Kumar Venkatesh, Isabel Funke, Micha Pfeiffer, Fiona Kolbinger, Hanna Maria Schmeiser, Juergen Weitz, Marius Distler, Stefanie Speidel

机构 * NCT/UCC Dresden(德累斯顿NCT/UCC) DKFZ Heidelberg(海德堡DKFZ) Faculty of Medicine & University Hospital Carl Gustav Carus TU Dresden(德累斯顿技术大学医学学院及卡尔·古斯塔夫·卡尔医院) HZDR Dresden, Germany(德累斯顿HZDR) Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine & University Hospital Carl Gustav Carus Germany(德累斯顿NCT/UCC医学系及卡尔·古斯塔夫·卡尔医院) The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden, Germany(德累斯顿TUD tactile internet中心) Weldon School of Biomedical Engineering, Regenstrief Center for Healthcare Engineering (RCHE), Purdue University, USA(美国普渡大学生物医学工程学院及Regenstrief医疗工程中心) Department of Biostatistics and Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University, USA(美国印第安纳大学公共健康学院生物统计学与健康数据科学系) Department of Visceral, Thoracic and Vascular Surgery, University Hospital & Faculty of Medicine Carl Gustav Carus, TUD Germany(德累斯顿技术大学 visceral、胸腔及血管外科系及卡尔·古斯塔夫·卡尔医院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Early accept at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19165 2025-04-30 cs.CV 74%

IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos

Yuan Li, Ziqian Bai, Feitong Tan, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments CVPR2025; project page: https://y-u-a-n-l-i.github.io/projects/IM-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15996 2025-03-21 cs.GR cs.CV 74%

Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models

Marc Benedí San Millán, Angela Dai, Matthias Nießner

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10634 2025-03-18 cs.CV 74%

V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes

Yanming Zhang, Jun-Kun Chen, Jipeng Lyu, Yu-Xiong Wang

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project Website: https://immortalco.github.io/V2Edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00733 2025-03-14 cs.CV cs.GR cs.LG 74%

Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Jiahao Cui, Hui Li, Yun Zhan, Hanlin Shang, Kaihui Cheng, Yuqi Ma, Shan Mu, Hang Zhou, Jingdong Wang, Siyu Zhu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15191 2025-03-12 cs.CV cs.LG cs.SD eess.AS 74%

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Moayed Haji-Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Alper Canberk, Kwot Sin Lee, Vicente Ordonez, Sergey Tulyakov

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: snap-research.github.io/AVLink/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14531 2024-12-20 cs.CV 74%

Consistent Human Image and Video Generation with Spatially Conditioned Diffusion

Mingdeng Cao, Chong Mou, Ziyang Yuan, Xintao Wang, Zhaoyang Zhang, Ying Shan, Yinqiang Zheng

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project page: https://github.com/ljzycmd/SCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16726 2024-12-17 cs.CV cs.AI 74%

EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion

Haotian Wang, Yuzhe Weng, Yueyan Li, Zilu Guo, Jun Du, Shutong Niu, Jiefeng Ma, Shan He, Xiaoyan Wu, Qiming Hu, Bing Yin, Cong Liu, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments https://emotivetalk.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04462 2024-12-06 cs.CV 74%

4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion

Chaoyang Wang, Peiye Zhuang, Tuan Duc Ngo, Willi Menapace, Aliaksandr Siarohin, Michael Vasilkovsky, Ivan Skorokhodov, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project page: https://snap-research.github.io/4Real-Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17405 2024-09-25 cs.CV 74%

Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer

Ruizhi Shao, Youxin Pang, Zerong Zheng, Jingxiang Sun, Yebin Liu

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Our project website is https://human4dit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10285 2024-07-16 cs.CV 74%

Noise Calibration: Plug-and-play Content-Preserving Video Enhancement using Pre-trained Video Diffusion Models

Qinyu Yang, Haoxin Chen, Yong Zhang, Menghan Xia, Xiaodong Cun, Zhixun Su, Ying Shan

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ECCV 2024, Project Page: https://yangqy1110.github.io/NC-SDEdit/, Code Repo: https://github.com/yangqy1110/NC-SDEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16371 2023-08-01 cs.CV 74%

MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text

Junchen Zhu, Huan Yang, Wenjing Wang, Huiguo He, Zixi Tuo, Yongsheng Yu, Wen-Huang Cheng, Lianli Gao, Jingkuan Song, Jianlong Fu, Jiebo Luo

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Accepted by ACM-MM 2023 demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00874 2026-07-28 cs.CV cs.AI cs.LG cs.MM 73%

Latent Space Probing for Adult Content Detection in Video Generative Models

潜在空间探测用于视频生成模型中的成人内容检测

Alizishaan Khatri, Chiquita Prabhu

机构 * Wrynx Inc.(Wrynx公司) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。

Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03355 2026-07-03 cs.CV cs.LG eess.IV 73%

Rethinking Video Super-Resolution: Towards Diffusion-Based Methods without Motion Alignment

重新思考视频超分辨率:基于扩散的方法无需运动对齐

Zhihao Zhan, Wang Pang, Xiang Zhu, Yechao Bai

机构 * TopXGun Robotics(TopXGun机器人研究所) Nanjing University(南京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出基于扩散后验采样框架的视频超分辨率方法,无需显式估计光流或运动参数,通过学习现实物理规律来处理多种运动模式,实验证明其有效性。

Comments ICSPS 2025

Journal ref 17th International Conference on Signal Processing Systems (ICSPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05442 2025-08-05 cs.CV cs.AI eess.IV 73%

Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces

Aniruddha Mahapatra, Long Mai, David Bourgin, Yitian Zhang, Feng Liu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10002 2025-06-13 cs.MM cs.AI cs.CV cs.RO 73%

EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis

Jianwu Fang, Lei-Lei Li, Zhedong Zheng, Hongkai Yu, Jianru Xue, Zhengguo Li, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE-TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18837 2023-12-01 cs.CV cs.AI cs.LG cs.MM 73%

VIDiff: Translating Videos via Multi-Modal Instructions with Diffusion Models

Zhen Xing, Qi Dai, Zihao Zhang, Hui Zhang, Han Hu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07131 2023-10-12 eess.IV cs.CV 73%

Echocardiography video synthesis from end diastolic semantic map via diffusion model

Phi Nguyen Van, Duc Tran Minh, Hieu Pham Huy, Long Tran Quoc

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05464 2023-05-10 cs.CV cs.MM 73%

Style-A-Video: Agile Diffusion for Arbitrary Text-based Video Style Transfer

Nisha Huang, Yuxin Zhang, Weiming Dong

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏