arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2604.03181 2026-08-14 cs.RO cs.CV 版本更新 74%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 74%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV 74%

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23298 2026-06-23 cs.CV 新提交 74%

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Ocean4D:通过介质感知视频扩散的生成式水下4D重建

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22015 2026-05-22 cs.CV cs.AR 74%

ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration

ORBIS: 通过分布感知匹配的输出引导标记减少以加速视频扩散

Hangyeol Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出ORBIS,一种针对视频扩散Transformer的SW-HW协同设计加速器,通过利用前一时间步的输出激活获得更准确的token相似性,从而提高匹配质量并实现更高的标记减少比例,同时引入分布感知标记匹配算法和专用硬件设计,实现比现有方法更高的标记减少率、更快的速度和更低的能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 74%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19747 2026-04-22 cs.CV 74%

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

AnyRecon:基于视频扩散模型的任意视角3D重建

Yutian Chen, Shi Guo, Renbiao Jin, Tianshuo Yang, Xin Cai, Yawen Luo, Mingxin Yang, Mulin Yu, Linning Xu, Tianfan Xue

机构 * AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model(AnyRecon:任意视角3D重建与视频扩散模型)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 AnyRecon通过视频扩散模型实现任意视角3D重建,保留显式几何控制并支持灵活条件设置,通过全局场景记忆和几何感知条件策略提升大场景重建效率与鲁棒性。

Comments Webpage: https://yutian10.github.io/AnyRecon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16479 2026-04-21 cs.CV cs.AI 74%

Latent-Compressed Variational Autoencoder for Video Diffusion Models

视频扩散模型的潜在压缩变分自编码器

Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出一种潜在压缩方法,通过去除视频潜在表示中的高频成分而非直接减少通道数,提升视频生成质量与压缩效率。

Comments Accepted to CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI 74%

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video understanding(title);分类 cs.CV

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 74%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV 74%

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09819 2026-03-11 cs.CV 74%

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 74%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02092 2026-02-03 cs.CV 74%

FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space

FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型

FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong Jin, Minxuan Lin, Bo Liu, Celong Liu, Chongyang Ma, Xing Mei, Xiaohui Shen, Yaojie Shen, Fuwen Tan, Angtian Wang, Xiao Yang, Yiding Yang, Jiamin Yuan, Lingxi Zhang, Yuxin Zhang

机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。

Comments Project Page: https://kingofprank.github.io/fsvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00267 2026-02-03 cs.CV cs.AI 74%

PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成

Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li

机构 * Amazon Barcelona(亚马逊巴塞罗那)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 74%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频扩散模型 :video understanding(title);分类 cs.CV

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03502 2026-01-27 eess.IV cs.AI cs.GR 74%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 视频扩散模型 :video diffusion(title);分类 eess.IV

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07287 2026-01-13 cs.CV 74%

Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models

焦点引导:从语义弱层中解锁视频扩散模型的可控性

Yuanyang Yin, Yufan Deng, Shenghai Yuan, Kaipeng Zhang, Xiao Yang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance China(字节跳动中国)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19678 2025-12-23 cs.CV cs.AI 74%

WorldWarp: Propagating 3D Geometry with Asynchronous Video Diffusion

WorldWarp: 通过异步视频扩散传播3D几何

Hanyang Kong, Xingyi Yang, Xiaoxu Zheng, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 WorldWarp通过结合3D结构锚和2D生成细化器,利用时空扩散模型实现几何一致的视频生成,解决遮挡和复杂轨迹问题。

Comments Project page: https://hyokong.github.io/worldwarp-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07500 2025-12-15 cs.CV 74%

MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer

多主体视频动作迁移:通过视频扩散变换器实现

Penghui Liu, Jiangshan Wang, Yutong Shen, Shanhui Mo, Chenyang Qi, Yue Ma

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10687 2025-11-06 cs.CV 74%

Stable Part Diffusion 4D: Multi-View RGB and Kinematic Parts Video Generation

Hao Zhang, Chun-Han Yao, Simon Donné, Narendra Ahuja, Varun Jampani

机构 * Stability AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Page: https://stablepartdiffusion4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09656 2025-10-17 cs.CV 74%

KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation

Xingrui Wang, Jiang Liu, Ze Wang, Xiaodong Yu, Jialian Wu, Ximeng Sun, Yusheng Su, Alan Yuille, Zicheng Liu, Emad Barsoum

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08632 2025-10-14 cs.CV 74%

RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Dong Chen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig-Maximilians-Universität München (LMU Munich)(慕尼黑路德维希-马克西米利安大学) Huawei Heisenberg Research Center(华为海森堡研究中心) Technische Universität München (TUM)(慕尼黑技术大学) Albert-Ludwigs-Universität Freiburg(弗赖堡阿尔伯特-路易斯-大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09212 2025-10-13 cs.CV 74%

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

Wuyang Li, Wentao Pan, Po-Chien Luan, Yang Gao, Alexandre Alahi

机构 * EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: https://stable-video-infinity.github.io/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19690 2025-09-25 cs.CV 74%

From Prompt to Progression: Taming Video Diffusion Models for Seamless Attribute Transition

Ling Lo, Kelvin C. K. Chan, Wen-Huang Cheng, Ming-Hsuan Yang

机构 * National Yang Ming Chiao Tung University(阳明交通大学) Google DeepMind(谷歌DeepMind) National Taiwan University(国立台湾大学) UC Merced(加州大学梅尔塞德斯分校)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10568 2025-08-28 cs.CV cs.AI 74%

DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers

Lizhen Wang, Zhurong Xia, Tianshu Hu, Pengrui Wang, Pengfei Wei, Zerong Zheng, Ming Zhou, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04147 2025-08-07 cs.CV 74%

IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control

Lijuan Liu, Wenfa Li, Dongbo Zhang, Shuo Wang, Shaohui Jiao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11706 2025-05-27 cs.CV 74%

AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration

Wenhao Sun, Rong-Cheng Tu, Jingyi Liao, Zhao Jin, Dacheng Tao

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 18 pages, 14 figures. Accepted by ICML 2025. The code is available at https://github.com/wenhao728/AsymRnR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09858 2025-05-16 cs.CV 74%

Mission Balance: Generating Under-represented Class Samples using Video Diffusion Models

Danush Kumar Venkatesh, Isabel Funke, Micha Pfeiffer, Fiona Kolbinger, Hanna Maria Schmeiser, Juergen Weitz, Marius Distler, Stefanie Speidel

机构 * NCT/UCC Dresden(德累斯顿NCT/UCC) DKFZ Heidelberg(海德堡DKFZ) Faculty of Medicine & University Hospital Carl Gustav Carus TU Dresden(德累斯顿技术大学医学学院及卡尔·古斯塔夫·卡尔医院) HZDR Dresden, Germany(德累斯顿HZDR) Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine & University Hospital Carl Gustav Carus Germany(德累斯顿NCT/UCC医学系及卡尔·古斯塔夫·卡尔医院) The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden, Germany(德累斯顿TUD tactile internet中心) Weldon School of Biomedical Engineering, Regenstrief Center for Healthcare Engineering (RCHE), Purdue University, USA(美国普渡大学生物医学工程学院及Regenstrief医疗工程中心) Department of Biostatistics and Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University, USA(美国印第安纳大学公共健康学院生物统计学与健康数据科学系) Department of Visceral, Thoracic and Vascular Surgery, University Hospital & Faculty of Medicine Carl Gustav Carus, TUD Germany(德累斯顿技术大学 visceral、胸腔及血管外科系及卡尔·古斯塔夫·卡尔医院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Early accept at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19165 2025-04-30 cs.CV 74%

IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos

Yuan Li, Ziqian Bai, Feitong Tan, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments CVPR2025; project page: https://y-u-a-n-l-i.github.io/projects/IM-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏