TransVDM: Motion-Constrained Video Diffusion Model for Transparent Video Synthesis
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract)
FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Pennsylvania(宾夕法尼亚大学) ; Eyeline Labs(Eyeline实验室)
专题命中 视频扩散模型 :video generation(abstract,abstract_cn);video diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。
Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026
CachedSearch:用于视频扩散测试时搜索的免训练缓存探索
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 研究视频扩散测试时搜索中缓存对候选者排名的影响,提出CachedSearch方法,通过积极缓存探索候选者,仅全计算时重生成获胜者,在多模型多系列中有效提升效率,以低成本获高增益,且免训练、与验证器无关,可用于测试时扩展。
NaviCache: 视频生成的测试时自校准缓存
机构 * Zhejiang University(浙江大学) ; Cornell University(康奈尔大学) ; Tencent Hunyuan(腾讯文生视频)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。
Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
在视频扩散Transformer中实现时间可编辑性
机构 * Kandinsky Lab(坎迪斯基实验室)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。
量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正
机构 * Technical University of Munich(慕尼黑技术大学) ; Tensordyne
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。
Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S
Bernini: 视频扩散中的潜在语义规划
机构 * Bernini Team(伯尼尼团队)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。
Comments Project Page: https://bernini-ai.github.io/
FreqFormer:具有自适应频谱路由的分层频域注意力机制用于长序列视频扩散变换器
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 FreqFormer通过分层频域注意力机制,利用视频特征的频谱结构,采用不同操作符处理不同频段,降低长序列视频扩散变换器的计算与内存开销。
Comments 24 pages, 17 figures, 14 tables, Technical Report
用于联合音频视频生成的扩散模型
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
何时锁定注意力:视频扩散中的无训练KV控制
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。
Comments 18 pages, 9 figures, 3 tables
自回归视频扩散模型的误差分析:一个统一的框架
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Sea AI Lab(海思人工智能实验室) ; Yale University(耶鲁大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
AI总结 本文提出Meta-ARVDM框架,通过分析自回归视频扩散模型的历史遗忘与时间退化现象,揭示其理论机制并提出新的评估方法。
机构 * Snap Inc.(Snap公司) ; Northeastern University(东北大学)
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments 21 pages, 9 figures, 13 tables
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
Comments Our demos are available at https://uniform-t2av.github.io/
机构 * DCST, Tsinghua University(清华大学智能驾驶实验室) ; Baidu Inc.(百度公司) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Zhongguancun Laboratory(中关村实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、cs.MM
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025. Project page: https://guanjz20.github.io/projects/AudCast
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
Comments 11 pages, 10 figures, CVPR 2025
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments 11 pages, 8 figures, 3 tables
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV
Comments Accepted to MICCAI 2024
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、cs.MM
专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments Accepted by NeurIPS2022
专题命中 视频扩散模型 :video-language(title,abstract);分类 cs.CV、cs.MM
Comments ACM Multimedia 2021
DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复
机构 * ACE Robotics(ACE机器人公司) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。
Comments Project Page: https://ggxxii.github.io/dreamhand/
HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Adobe Research(奥多比研究院) ; The Chinese University of Hong Kong(香港中文大学) ; CPII under InnoHK(InnoHK下属CPII机构)
专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。
Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD
LoSA:用于无训练视频扩散加速的近无损稀疏注意力
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。
RayPE: 用于3D感知视频生成的射线空间位置编码
机构 * The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; ARC Lab, Tencent(腾讯ARC Lab)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 提出RayPE,通过向自注意力注入6D Plücker坐标编码射线几何关系,提升视频扩散Transformer的3D一致性和相机可控性。
Comments Project page: https://visual-ai.github.io/scope/
HASTE:通过头级自适应稀疏注意力实现无训练视频扩散加速
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 本文提出HASTE框架,通过时间掩码复用和误差引导预算校准,提升无训练稀疏注意力在视频生成中的速度与质量平衡,实现在720P下1.93倍的加速效果。
MirrorWorld:利用视频扩散模型生成镜像反射
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。
Comments Project Page: https://youjunzhao.github.io/MirrorWorld/
上下文强制:揭示自回归视频扩散中的上下文效应
机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) ; Tencent Youtu Lab(腾讯云图实验室) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 针对自回归视频扩散模型依赖干净帧导致的时间一致性差等问题,提出In-Context Forcing方法,通过递减噪声水平的上下文实现自适应指导,兼具时间一致性与动态性,还可并行去噪加速推理,在VBench上性能优于SOTA。
UniWorld-View:基于视频扩散模型的大基线视图合成
机构 * Peking University(北京大学) ; Rabbitpre AI
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 UniWorld-View 是结合显式 3D 指导与视频扩散建模的统一框架,可从单目输入实现可控大基线新视图合成,在基准测试中展现出优异的可控性、几何一致性与视觉保真度。
Comments Project Homepage: https://zhouhyocean.github.io/uniworld-view/ Code: https://github.com/PKU-YuanGroup/UniWorld-View