Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments 16 pages, 10 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments 16 pages, 10 figures
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments Project Website: https://immortalco.github.io/V2Edit/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project Page: snap-research.github.io/AVLink/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Project page: https://github.com/ljzycmd/SCD
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments https://emotivetalk.github.io/
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments Project page: https://snap-research.github.io/4Real-Video/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Our project website is https://human4dit.github.io
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV
Comments ECCV 2024, Project Page: https://yangqy1110.github.io/NC-SDEdit/, Code Repo: https://github.com/yangqy1110/NC-SDEdit/
专题命中 视频扩散模型 :video generation(title);分类 cs.CV
Comments Accepted by ACM-MM 2023 demo
潜在空间探测用于视频生成模型中的成人内容检测
机构 * Wrynx Inc.(Wrynx公司) ; Independent Researcher(独立研究者)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。
Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)
重新思考视频超分辨率:基于扩散的方法无需运动对齐
机构 * TopXGun Robotics(TopXGun机器人研究所) ; Nanjing University(南京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 本文提出基于扩散后验采样框架的视频超分辨率方法,无需显式估计光流或运动参数,通过学习现实物理规律来处理多种运动模式,实验证明其有效性。
Comments ICSPS 2025
Journal ref 17th International Conference on Signal Processing Systems (ICSPS), 2025
机构 * Adobe Research(Adobe研究院) ; Northeastern University(东北大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/
机构 * Xi’an Jiaotong University(西安交通大学) ; University of Macau(澳门大学) ; National University of Singapore(新加坡国立大学) ; Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) ; Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE-TMM
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 视频扩散模型 :video diffusion(title)
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; University of Toronto(多伦多大学) ; Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)
专题命中 视频扩散模型 :video diffusion(title)
Comments Data Curation and Augmentation in Medical Imaging CVPR 2024
Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码
机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)
专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。
Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/
AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正
机构 * Columbia University(哥伦比亚大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。
MiniWorld:从零开始普及视频世界模型的训练
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。
Comments 19 pages
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/
Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景
穿越绘画:来自互联网先验的自我中心世界模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Research Institute(丰田研究机构)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。
OmniCache:用于扩散模型的多维分层特征缓存
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。
循环自回归扩散:全局记忆与局部注意力相结合
机构 * Peking University(北京大学) ; Princeton University(普林斯顿大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。
Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/
具有世界状态寄存器的流式多智能体自回归扩散模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Adobe Research(Adobe研究院)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。
Comments Project page: https://vail-ucla.github.io/worldweaver/
RealVDeblur:用于通用真实世界视频去模糊的一步扩散法
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多媒体实验室) ; CPII under InnoHK(创新香港研究院下的CPII) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。
Comments Project page with code: https://rbjin.github.io/RealVDeblur/
生成模型了解空间:解锁隐式3D先验用于场景理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Baidu Inc.(百度公司)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。
Comments Accepted by ECCV 2026