arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2506.19840 2026-04-20 cs.CV 77%

GenHSI: Controllable Generation of Human-Scene Interaction Videos

GenHSI: 可控生成人类-场景交互视频

Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 GenHSI提出一种无需训练的可控生成长人类-场景交互视频方法,通过剧本写作、预可视化和动画三阶段生成3D-aware视频,保留人物身份并提供合理交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 77%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04698 2025-05-14 cs.CV 77%

ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning

Yuzhou Huang, Ziyang Yuan, Quande Liu, Qiulin Wang, Xintao Wang, Ruimao Zhang, Pengfei Wan, Di Zhang, Kun Gai

机构 * Sun Yat-sen University(中山大学) Kuaishou Technology(快手科技) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://yuzhou914.github.io/ConceptMaster/. Update and release MCVC Evaluation Set

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10678 2025-03-17 cs.CV 77%

VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion

Lehan Yang, Jincen Song, Tianlong Wang, Daiqing Qi, Weili Shi, Yuheng Liu, Sheng Li

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05651 2025-03-04 cs.CV cs.AI cs.LG 77%

ViBiDSampler: Enhancing Video Interpolation Using Bidirectional Diffusion Sampler

Serin Yang, Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments ICLR 2025; Project page: https://vibidsampler.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15249 2024-12-20 cs.CV cs.AI cs.LG 77%

Spectral Motion Alignment for Video Motion Transfer using Diffusion Models

Geon Yeong Park, Hyeonho Jeong, Sang Wan Lee, Jong Chul Ye

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments AAAI 2025, Project page: https://geonyeong-park.github.io/spectral-motion-alignment/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04432 2024-12-06 cs.CV 77%

Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation

Yuying Ge, Yizhuo Li, Yixiao Ge, Ying Shan

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project released at: https://github.com/TencentARC/Divot

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11473 2024-11-05 cs.CV cs.AI 77%

FIFO-Diffusion: Generating Infinite Videos from Text without Training

Jihwan Kim, Junoh Kang, Jinyoung Choi, Bohyung Han

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Project Page: https://jjihwan.github.io/projects/FIFO-Diffusion

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07685 2023-03-31 cs.CV cs.LG 77%

Video Probabilistic Diffusion Models in Projected Latent Space

Sihyun Yu, Kihyuk Sohn, Subin Kim, Jinwoo Shin

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://sihyun.me/PVDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01700 2026-07-21 cs.CV cs.MM 版本更新 76%

Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation

视频扩散模型能否预测过去帧?双向循环一致性用于可逆插值

Lingyu Liu, Yaxiong Wang, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) School of Computer and Information Science, Hefei University of Technology(合肥工业大学计算机与信息科学学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出双向循环一致性框架,通过双向生成轨迹对称性提升视频插值的时序一致性,实验表明在37帧和73帧任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM 76%

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13967 2026-03-17 eess.IV cs.AI cs.CV 76%

EchoLVFM: One-Step Video Generation via Latent Flow Matching for Echocardiogram Synthesis

EchoLVFM: 通过潜在流匹配实现单步视频生成用于超声心动图合成

Emmanuel Oladokun, Sarina Thomas, Jurica Šprem, Vicente Grau

专题命中 视频扩散模型 :video generation(title);分类 cs.CV、eess.IV

AI总结 本文提出EchoLVFM框架,通过潜在空间单步生成可控的超声心动图视频,提升效率并保持视觉质量,实验证明其在单帧条件下的视频质量与专家判断准确率。

Comments Submitted to MICCAI 2026; Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17842 2025-02-26 cs.CV cs.LG cs.MM cs.SD eess.AS 76%

MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

专题命中 视频扩散模型 :video generation(title);分类 cs.CV、cs.MM

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新 74%

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 74%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17975 2026-06-30 cs.CV 74%

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY! 从YouTube视频中通过高斯点云和视频扩散先验构建可动画的遮挡人类

Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Imperial College London(帝国理工学院) KAUST(阿卜杜拉国王科技大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出AHOY方法,通过高斯点云和视频扩散先验从真实视频中重建完整可动画3D人体,解决遮挡挑战,提出四点贡献:生成监督、两阶段架构、解耦策略、头身监督。

Comments ECCV 2026. Project page is available at https://miraymen.github.io/ahoy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23298 2026-06-23 cs.CV 新提交 74%

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Ocean4D:通过介质感知视频扩散的生成式水下4D重建

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22015 2026-05-22 cs.CV cs.AR 74%

ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration

ORBIS: 通过分布感知匹配的输出引导标记减少以加速视频扩散

Hangyeol Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出ORBIS,一种针对视频扩散Transformer的SW-HW协同设计加速器,通过利用前一时间步的输出激活获得更准确的token相似性,从而提高匹配质量并实现更高的标记减少比例,同时引入分布感知标记匹配算法和专用硬件设计,实现比现有方法更高的标记减少率、更快的速度和更低的能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 74%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19747 2026-04-22 cs.CV 74%

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

AnyRecon:基于视频扩散模型的任意视角3D重建

Yutian Chen, Shi Guo, Renbiao Jin, Tianshuo Yang, Xin Cai, Yawen Luo, Mingxin Yang, Mulin Yu, Linning Xu, Tianfan Xue

机构 * AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model(AnyRecon:任意视角3D重建与视频扩散模型)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 AnyRecon通过视频扩散模型实现任意视角3D重建,保留显式几何控制并支持灵活条件设置,通过全局场景记忆和几何感知条件策略提升大场景重建效率与鲁棒性。

Comments Webpage: https://yutian10.github.io/AnyRecon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16479 2026-04-21 cs.CV cs.AI 74%

Latent-Compressed Variational Autoencoder for Video Diffusion Models

视频扩散模型的潜在压缩变分自编码器

Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出一种潜在压缩方法,通过去除视频潜在表示中的高频成分而非直接减少通道数,提升视频生成质量与压缩效率。

Comments Accepted to CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI 74%

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video understanding(title);分类 cs.CV

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 74%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV 74%

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09819 2026-03-11 cs.CV 74%

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 74%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02092 2026-02-03 cs.CV 74%

FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space

FSVideo: 一种在高度压缩潜在空间中的快速速度视频扩散模型

FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong Jin, Minxuan Lin, Bo Liu, Celong Liu, Chongyang Ma, Xing Mei, Xiaohui Shen, Yaojie Shen, Fuwen Tan, Angtian Wang, Xiao Yang, Yiding Yang, Jiamin Yuan, Lingxi Zhang, Yuxin Zhang

机构 * FSVideo Team Intelligent Creation(FSVideo团队智能创作)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 FSVideo通过高度压缩的潜在空间和改进的扩散Transformer架构,在速度和质量上实现了高效视频生成。

Comments Project Page: https://kingofprank.github.io/fsvideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00267 2026-02-03 cs.CV cs.AI 74%

PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories

PLACID:通过视频扩散与合成轨迹实现身份保持的多物体合成

Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li

机构 * Amazon Barcelona(亚马逊巴塞罗那)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 PLACID通过视频扩散与合成轨迹实现多物体合成,保持物体身份和背景细节,提升合成效果与视觉吸引力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 74%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 视频扩散模型 :video understanding(title);分类 cs.CV

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03502 2026-01-27 eess.IV cs.AI cs.GR 74%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 视频扩散模型 :video diffusion(title);分类 eess.IV

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏