MagicVideo: Efficient Video Generation With Latent Diffusion Models
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复
机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)
专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV
AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。
Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg
HiAR:通过分层去噪实现高效的自回归长视频生成
专题命中 视频扩散模型 :video generation(title);long video(title);分类 cs.CV
AI总结 HiAR通过分层去噪框架在保持时间连续性的同时减少误差传播,实现高效长视频生成。
Comments Project page: https://jacky-hate.github.io/HiAR/ Code: https://github.com/Jacky-hate/HiAR
NEGATE: 用于文本到视频扩散中的语义约束指导以处理语言否定
机构 * University of Maryland at College Park(马里兰大学 College Park 分校)
专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV
AI总结 本文提出了一种基于扩散模型的语义约束指导方法,用于处理文本到视频生成中的语言否定问题,通过结构化约束实现否定的统一建模。
Comments 50 pages, 32 figures
机构 * PRIS, School of Artificial Intelligence, Beijing University of Posts(PRIS人工智能学院,北京邮电大学) ; SketchX, CVSSP, University of Surrey(SketchX,计算机视觉与模式识别研究所,萨里大学)
专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);分类 cs.CV
Comments 2024 IEEE International Conference on Visual Communications and Image Processing (VCIP); Oral
Steady-Forcing: 长时程自然视频扩散中空间持久性与运动连续性的平衡
机构 * Department of Computer Science and Engineering, Sogang University(西江大学计算机科学与工程系) ; Department of Artificial Intelligence, Sogang University(西江大学人工智能系)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出Steady-Forcing框架,通过视觉锚点、运动记忆和蒸馏等技术,在长时程固定相机自然视频生成中平衡背景稳定与运动连续性,优于现有方法。
Comments Project page: https://minar09.github.io/steadyforcing/
迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制
机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) ; Hupan Lab(虎盘实验室) ; Zhejiang University(浙江大学) ; INSAIT
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV
AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。
Comments Project page: https://jingyunliang.github.io/MeshToken/
AttentionBender: 在视频扩散变换器中操纵交叉注意力作为创造性探测工具
机构 * University of the Arts London(伦敦艺术大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM
AI总结 AttentionBender通过操纵视频扩散变换器中的交叉注意力,帮助艺术家探索黑箱视频生成的内部机制,揭示交叉注意力的高度交织特性,并产生新的美学效果。
Comments To appear in the Proceedings of the 2026 ACM Creativity and Cognition (C&C '26). 15 pages, 19 figures
视频扩散时间步中的运动编码表征
机构 * University of Maryland(马里兰大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV
AI总结 本文通过分析视频扩散模型中时间步的运动与外观编码特性,发现早期时间步主导运动,后期主导外观,并提出受限于运动主导阶段的运动定制方法。
Comments 10 pages, 4 figures
机构 * Snap Inc. ; Northeastern University(东北大学)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments 17 pages, 6 figures, 9 tables
机构 * The University of Sydney, Sydney, Australia(悉尼大学) ; The University of Hong Kong, Hong Kong SAR, China(香港大学) ; The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
Comments MICCAI 2025
机构 * NVIDIA ; Seoul National University(首尔国立大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV
Comments Project page: https://research.nvidia.com/labs/dair/geoman
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、cs.MM
Comments ACM Multimedia 2024. Source code is available at \url{https://github.com/yanghb22-fdu/Hi3D-Official}
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV
并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成
机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Shenzhen University of Advanced Technology(深圳理工大学)
专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。
FadeMem: 面向自回归视频扩散的距离感知记忆巩固
机构 * Zhejiang University(浙江大学) ; University of New South Wales (UNSW)(新南威尔士大学) ; Data61/CSIRO ; Baidu Inc(百度公司)
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);long video(abstract);分类 cs.CV
AI总结 提出FadeMem,一种距离感知的KV记忆巩固机制,在固定缓存预算下将历史KV块组织成时间层次,通过幂律分配实现近密远疏的记忆,提升长视频生成中的主体一致性和时间连贯性。
Comments 14 pages, 9 figures. Substantially revised manuscript with expanded experiments and integrated supplementary material. Project page: https://fademem.github.io/FadeMem_Webpage/
ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染
机构 * University of Rochester(罗切斯特大学) ; Pixocial Technology(Pixocial技术)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。
Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web
揭秘视频推理
机构 * SenseTime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频扩散模型 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV
AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。
Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning
MobileWan:弥合移动视频扩散的质量差距
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。
用于逼真自回归视频生成的测试时噪声引导适应
机构 * Information Technologies Institute, CERTH(信息技术研究所,希腊研究与技术中心) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对自回归视频扩散模型误差积累问题,提出TANGO方法,通过噪声引导优化避免模型陷入终点,在VBench上有显著改进,降低了弗雷歇视频距离。
Comments ECCV2026
Flex-Forcing:迈向统一的自回归和双向视频扩散模型
机构 * NVIDIA(英伟达)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 研究针对现有视频生成方法推理范式僵化的问题,提出Flex-Forcing框架。核心是灵活分块机制,可依设备预算灵活分块,跨块双向推理与块内自回归生成,实验表明该框架提升了视频质量、稳定性并加快推理速度。
Comments Project page: https://research.nvidia.com/labs/genair/flex-forcing
ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。
Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/
LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。
Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch
通过PRISM:视频扩散模型中间状态中的偏好表示
机构 * City University of Hong Kong(香港城市大学) ; Video Rebirth ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 提出PRISM方法,利用冻结的视频扩散骨干网络和轻量级查询聚合头从噪声潜变量中解码偏好信号,实现高精度偏好预测和噪声鲁棒性,支持早期最佳采样以降低计算成本并提升视频质量。
Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型
机构 * University of Washington(华盛顿大学) ; World Labs
专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。
Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/
Pantheon360: 通过3D感知的360°视频扩散驯服数字孪生生成
机构 * University of Southern California(南加州大学) ; National Yang Ming Chiao Tung University(国家阳明交通大学) ; Cornell University(康奈尔大学) ; Bosch Research(博世研究)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 提出Pantheon360框架,利用显式3D缓存从稀疏360°输入生成高保真视频,实现全局几何一致性和可控相机路径,解决传统透视视频生成器视野受限导致的跨视图不一致和时间漂移问题。
Comments Accepted to CVPR 2026. Project page: https://koi953215.github.io/pantheon360_page/
MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型
机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) ; School of Computer Science, Peking University(北京大学计算机学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
专题命中 视频扩散模型 :video diffusion(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。
Comments Accepted by CVPR 2026
移动视频扩散
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种移动优化的视频扩散模型MobileVD,通过降低帧分辨率、引入多尺度时间表示和两种新的剪枝方案,显著降低了内存和计算成本,同时在移动设备上实现了高效的视频生成。