Image Motion Blur Removal in the Temporal Dimension with Video Diffusion Models
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
Comments Accepted to MICCAI 2024
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by NeurIPS2022
专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments ACM Multimedia 2021
HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Adobe Research(奥多比研究院) ; The Chinese University of Hong Kong(香港中文大学) ; CPII under InnoHK(InnoHK下属CPII机构)
专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。
Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD
LoSA:用于无训练视频扩散加速的近无损稀疏注意力
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。
RayPE: 用于3D感知视频生成的射线空间位置编码
机构 * The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; ARC Lab, Tencent(腾讯ARC Lab)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。
Comments Project page: https://visual-ai.github.io/scope/
HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。
MirrorWorld:利用视频扩散模型生成镜像反射
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。
Comments Project Page: https://youjunzhao.github.io/MirrorWorld/
上下文强制:揭示自回归视频扩散中的上下文效应
机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; Tencent Youtu Lab(腾讯云图实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。
UniWorld-View:基于视频扩散模型的大基线视图合成
机构 * Peking University(北京大学) ; Rabbitpre AI
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。
Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View
SIFT: 视频扩散模型中物理合理运动的自我想象微调
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。
Comments ECCV 2026
DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。
Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/
轻量强制:通过稀疏注意力加速自回归视频扩散
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。
Comments ICML 2026
AniCrafter:基于视频扩散模型中化身-背景条件的逼真以人为中心动画定制
机构 * The University of Tokyo(东京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出AniCrafter模型,通过在视频扩散模型中引入化身-背景条件机制,解决现有角色动画方法在开放域场景中效果受限的问题,其性能优于现有最先进方法,可生成通用且可感知遮挡的动画结果。
Comments Homepage: https://myniuuu.github.io/AniCrafter ; Codes: https://github.com/MyNiuuu/AniCrafter
WildShadowRemover:基于细节保留视频扩散模型的野外视频阴影去除方法
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对野外视频阴影去除难题,提出WildShadowRemover框架,通过LoRA微调适配视频扩散模型,结合细节注入、频率分解调制及Depth Anything 3深度先验,构建对应数据集,在阴影去除质量与时间一致性上优于现有方法。
ViDS:使用3D面部跟踪的视频扩散着色器
机构 * Technical University of Munich(慕尼黑工业大学) ; Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) ; Woven by Toyota(丰田编织)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。
Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/
MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力
机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。
HeadCast:为高效自回归视频生成分配注意力头
机构 * KlingAI Research(克林人工智能研究公司)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 研究针对自回归视频扩散模型注意力成本高的问题,提出HeadCast框架,基于预训练模型注意力头行为进行一次性分类,重组KV缓存,保留全局头,在不同分辨率下有效加速推理且保持质量,减少闪烁。
MagicPrompt:用于视频生成的超轻量级提示调整
机构 * HKUST(香港科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; Tencent(腾讯)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 研究针对大规模视频扩散模型下游任务微调计算成本高的问题,提出MagicPrompt轻量级框架。采用注意力嵌入提示调整和双空间奖励反馈优化,在可训练参数不到1%时达竞争性能,显著降低训练成本。
SGMD: 得分梯度匹配蒸馏用于少步视频扩散蒸馏
机构 * Beihang University(北京航空航天大学) ; SenseTime Research(商汤科技研究院) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对分布匹配蒸馏在少步视频扩散中训练昂贵且运动动态保守的问题,提出得分梯度匹配蒸馏(SGMD),通过直接优化假得分朝向教师并使用教师停止梯度Fisher作为稳定目标,实现约3倍训练加速并显著提升运动动态。
Comments ICML 2026
STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散
机构 * Imperial College London, UK(伦敦帝国理工学院) ; FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。
Comments ICML 2026
ACID:用于视频生成的自适应缓存
机构 * UT Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。
Comments 16 pages, 12 figures
LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; Bosch Research(博世研究)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。
Comments Project page: https://www.zixinguo.me/lightcrafter
视频扩散模型中的序列性差距
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。
Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com
LVMark:用于潜在视频扩散模型的鲁棒水印
机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) ; Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。
LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。
Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/
视频扩散模型在手部运动重建中的惊人有效性
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。