Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments The project is available at: https://github.com/Picsart-AI-Research/Text2Video-Zero
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments The project is available at: https://github.com/Picsart-AI-Research/Text2Video-Zero
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments Project page at https://research.runwayml.com/gen1
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.MM
Comments Audio samples are available at https://Text-to-Audio.github.io
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments 9 pages, 2 tables, 7 figures
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments Published in TMLR (11/2022)
Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)
AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。
用于长期规划的带引导搜索的组合扩散
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract)
AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。
Comments 38 pages, 18 figures, ICLR 2026 ORAL
GF-DiT:扩散Transformer服务的并行调度
机构 * Shanghai Jiao Tong University(上海交通大学) ; Guizhou University(贵州大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)
AI总结 提出GF-DiT,一种策略可编程运行时,通过动态调整请求并行度来优化扩散Transformer服务,利用无组集合通信实现低开销在线重配置,显著提升吞吐量和降低延迟。
粗到细的组合扩散用于长时域规划
机构 * KAIST(韩国科学技术院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract)
AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。
Comments Project page: https://cofi-diffusion.github.io
DiT4DiT:联合建模视频动态与动作以实现通用机器人控制
机构 * Mondo Robotics(Mondo机器人公司) ; HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)
AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。
Comments https://dit4dit.github.io/
euphonium:通过过程奖励梯度引导的随机动态控制视频流匹配
机构 * Huazhong University of Science and Technology(华中科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent Hunyuan(腾讯混元) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract)
AI总结 Euphonium通过过程奖励梯度引导动态,提升视频流匹配的生成效率和对齐性。
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Beijing Institute of Technology(北京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Hunan University(湖南大学) ; Shanghai AI Lab(上海人工智能实验室) ; HEBUST
专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV、eess.IV、cs.MM
Comments Accepted to NeurIPS 2025. The dataset and code are available at https://github.com/KPeng9510/HopaDIFF
机构 * KAIST(韩国科学技术院) ; DeepBrain AI Inc.(DeepBrain AI公司)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM
Comments ICCV 2025. Project page: https://deepbrainai-research.github.io/float/
机构 * Technical University of Munich(慕尼黑技术大学) ; Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)
Comments short version (working in progress)
从合成到去除:基于物理的反射模拟与基于扩散的视频去反射
机构 * Xiaomi Inc.(小米公司) ; MiLM Plus
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。
Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R
基于自适应分数蒸馏的生成式视频压缩
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。
眩晕眩晕:通过其预测性AI双重重建电影理想
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。
Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version
图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频扩散模型 :video-language(abstract);分类 cs.CV、cs.MM
AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。
Comments Published in ACM MM 2025. Address some typos
TurboTalk: 一步生成音频驱动的虚拟角色的渐进蒸馏
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Meituan(美团) ; The Hong Kong Polytechnic University(香港理工大学) ; CAIR, HKISI, CAS(中国科学院CAS HKISI CAIR)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出TurboTalk框架,通过分布匹配蒸馏和对抗蒸馏逐步压缩多步音频驱动视频扩散模型,实现单步生成高质量虚拟角色,推理速度提升120倍。
DiV-INR:基于INR条件的极端低比特率扩散视频压缩
专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM
AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。
EARTalking:端到端的GPT风格自回归说话头合成与帧级控制
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK ; Zhejiang University(浙江大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。
MEt3R:测量生成图像的多视图一致性
机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; Saarland Informatics Campus(萨尔州信息校园) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV
AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。
Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version
EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器
机构 * Pipio AI ; Amazon(亚马逊)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。
Comments Project page: https://edit-yourself.github.io/
音频-视觉跨模态压缩用于生成式面部视频编码
专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM
AI总结 本文提出AVCC框架,通过联合压缩音频和视频流,提升生成式面部视频编码的率-失真性能。
Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
机构 * GVC Lab, Great Bay University(Great Bay大学GVC实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
Comments Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
Comments ICML 25. Project page: https://junlinhan.github.io/projects/flex3d/
机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China, and University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院信息处理重点实验室,计算技术研究所,北京,100190,中国,以及中国科学院大学,北京100049,中国)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM
Comments Accepted by IEEE Transactions on Multimedia
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV
Comments 4 pages