DISK: Dynamic Inference SKipping for World Models
DISK:用于世界模型的动态推理跳过
机构 * Purdue University, West Lafayette, United States(普渡大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
DISK:用于世界模型的动态推理跳过
机构 * Purdue University, West Lafayette, United States(普渡大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DISK通过动态推理跳过技术,在无需训练的情况下提升自回归世界模型的视频和轨迹预测效率,同时保持预测精度和视觉质量。
GR3EN: 生成式3D环境光照
机构 * Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 GR3EN通过将视频到视频扩散模型输出蒸馏到3D重建中,实现对房间尺度场景的可控3D光照调整,无需解决逆渲染问题,适用于复杂现实场景。
Comments project page: https://gr3en-relight.github.io/
FreeFix: 通过无微调扩散模型提升3D高斯散射
机构 * Zhejiang University(浙江大学) ; University of Maryland, College Park(马里兰大学学院 park 分校) ; Huawei(华为)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 FreeFix通过无微调扩散模型提升3D高斯散射,实现高质量视图合成与强泛化能力。
Comments Our project page is at https://xdimlab.github.io/freefix
TwinFlow: 在大模型上实现一步生成的自对抗流
机构 * Inclusion AI ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。
Comments arxiv v1, accepted to ICLR 2026
QVGen:推动量化视频生成模型的极限
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Beihang University(北京航空航天大学) ; SenseTime Research(商汤科技研究院) ; Monash University(墨尔本大学) ; Nanyang Technological University(南洋理工大学) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 QVGen通过量化感知训练框架在极低比特下实现高性能视频生成模型,首次达到全精度质量并优于现有方法。
Comments Accepted by ICLR 2026
Astra:通用交互世界模型与自回归去噪
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。
Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra
HiCache: 一种基于赫尔米特多项式的插件式泰勒风格缓存加速框架
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 HiCache通过基于赫尔米特多项式的插件式方法,提升扩散模型的推理速度和预测精度,实现5.55倍的加速并保持高质量输出。
TaQ-DiT: 时感知量化用于扩散变换器
专题命中 视频扩散模型 :video generation(abstract);分类 eess.IV
AI总结 TaQ-DiT通过引入时感知量化方法,解决扩散变换器中权重和激活的非收敛问题及不同层的量化敏感性差异,提升量化效果。
Yesnt:扩散重照明模型是否准备好用于捕获阶段合成?一种混合方法用于弥合差距
机构 * University of Bonn(波恩大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出一种混合重照明框架,结合扩散先验与物理约束,实现更稳定的视频重照明效果。
ScenDi: 3D到2D场景扩散级联用于城市生成
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; The University of British Columbia(不列颠哥伦比亚大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。
VideoMaMa: 通过生成先验进行掩码引导的视频磨皮
机构 * Korea University(韩国大学) ; Adobe Research(Adobe研究) ; KAIST AI(韩国科学技术院人工智能)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究
Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/
DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(虎扑实验室) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。
Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456
预测主成分,稳定残差:面向高效扩散变换器的子空间感知特征缓存
机构 * Shanghai Jiao Tong University(上海交通大学) ; Sun Yat-Sen University(中山大学) ; South China University of Technology(华南理工大学) ; Jilin University(吉林大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出SVD-Cache方法,通过子空间感知的特征缓存技术提升扩散变换器的推理效率,实现近无损效果并支持多种加速技术。
DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。
Comments Accepted to AAAI 2026
DreamLoop:从单张照片生成可控的cinemagraph
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。
Comments Project Page: https://anime26398.github.io/dreamloop.github.io/
通过混合几何扩散学习动作层次结构
专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV
AI总结 本文提出HybridTAS框架,通过混合欧几里得和双曲几何提升时间动作分割的层次结构建模能力,实验表明其在多个数据集上达到最优性能。
Comments Accepted at WACV-26
DriveExplorer: 基于图像的解耦4D重建与渐进修复用于驾驶视角外推
机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省级超高清沉浸媒体技术重点实验室) ; School of Electronic and Computer Engineering(电子与计算机工程学院) ; Shenzhen Graduate School, Peking University(北京大学深圳研究生院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DriveExplorer通过图像解耦和渐进修复实现驾驶视角外推,利用4D高斯框架和扩散模型提升重建质量。
可控的人本关键帧插值与生成先验
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。
Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI
高保真长时长人类图像动画
机构 * Guangzhou Quwan Network Technology(广州 quirwan 网络技术公司) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出基于扩散变压器的框架,通过混合引导信号和位置移适应模块,实现高保真长时长人类图像动画生成。
EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团) ; Nanyang Technology University(南阳技术大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。
Comments 26 pages, 16 figures
FlashPortrait: 6倍更快的无限人物动画生成
机构 * Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Xi’an Jiaotong University(西安交通大学) ; Tencent Inc.(腾讯公司) ; Tongyi Lab, Alibaba Group(阿里云通义实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 FlashPortrait通过归一化面部表情块和动态滑动窗口方案,实现6倍加速的无限长人物动画生成,保持身份一致性。
CoVAR: 通过多模态扩散生成视频与动作用于机器人操作
机构 * University of Freiburg(弗赖堡大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Technical University of Munich(慕尼黑技术大学) ; Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。
Comments 9 pages, 7 figures
ConsistTalk: 可控强度的时序一致说话头生成与扩散噪声搜索
机构 * The corresponding author.(通讯作者)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 ConsistTalk通过引入光流引导时间模块、音频到强度模型和扩散噪声初始化策略,实现了可控强度和时序一致的说话头生成,有效减少闪烁并提升音频视频同步质量。
Comments AAAI26 poster
AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。
Comments AAAI 2026
DiffusionBrowser: 通过多分支解码器实现交互式扩散预览
机构 * University of Washington(华盛顿大学) ; Adobe Research(Adobe研究)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。
Comments Project page: https://susunghong.github.io/DiffusionBrowser
LINA: 为扩散模型中的物理对齐和泛化学习适应性干预
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。
生成性时空数据增强
机构 * University of Chicago(芝加哥大学) ; University of Michigan, Ann Arbor(安娜堡大学) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出利用视频扩散模型生成时空数据以增强模型性能,尤其在数据稀缺情况下提升模型表现。
FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画
机构 * Meta Reality Labs(Meta现实实验室) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。
Comments Project page: https://tangjiapeng.github.io/FactorPortrait/
FilmWeaver: 通过缓存引导自回归扩散编织一致的多镜头视频
机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 FilmWeaver通过缓存引导自回归扩散模型实现多镜头视频的一致性生成,支持灵活交互和多任务应用。
Comments AAAI-2026
PersonaLive! 用于直播的 expressive 人物图像动画
机构 * University of Macau(澳门大学) ; GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 PersonaLive通过多阶段训练方法实现了实时面部动画生成,提升了效率和稳定性,达到7-22倍的速度提升。