arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2303.13439 2023-03-24 cs.CV 70%

Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators

Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan, Roberto Henschel, Zhangyang Wang, Shant Navasardyan, Humphrey Shi

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments The project is available at: https://github.com/Picsart-AI-Research/Text2Video-Zero

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03011 2023-02-07 cs.CV 70%

Structure and Content-Guided Video Synthesis with Diffusion Models

Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, Anastasis Germanidis

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page at https://research.runwayml.com/gen1

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12661 2023-01-31 cs.SD cs.LG cs.MM eess.AS 70%

Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models

Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments Audio samples are available at https://Text-to-Audio.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03250 2022-12-08 cs.CV 70%

Neural Cell Video Synthesis via Optical-Flow Diffusion

Manuel Serna-Aguilera, Khoa Luu, Nathaniel Harris, Min Zou

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 9 pages, 2 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07696 2022-11-15 cs.CV cs.LG stat.ML 70%

Diffusion Models for Video Prediction and Infilling

Tobias Höppe, Arash Mehrjou, Stefan Bauer, Didrik Nielsen, Andrea Dittadi

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Published in TMLR (11/2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 67%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 67%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13501 2026-07-03 cs.DC cs.LG cs.PF 新提交 67%

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT:扩散Transformer服务的并行调度

Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Guizhou University(贵州大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 提出GF-DiT,一种策略可编程运行时,通过动态调整请求并行度来优化扩散Transformer服务,利用无组集合通信实现低开销在线重配置,显著提升吞吐量和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 67%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10448 2026-03-24 cs.RO 67%

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

DiT4DiT:联合建模视频动态与动作以实现通用机器人控制

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang, Shuo Yang

机构 * Mondo Robotics(Mondo机器人公司) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。

Comments https://dit4dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04928 2026-02-09 cs.LG 67%

Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics

euphonium:通过过程奖励梯度引导的随机动态控制视频流匹配

Ruizhe Zhong, Jiesong Lian, Xiaoyue Mi, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Junchi Yan

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯混元) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract)

AI总结 Euphonium通过过程奖励梯度引导动态,提升视频流匹配的生成效率和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09650 2025-10-06 cs.CV cs.LG cs.MM cs.RO eess.IV 67%

HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios

Kunyu Peng, Junchao Huang, Xiangsheng Huang, Di Wen, Junwei Zheng, Yufan Chen, Kailun Yang, Jiamin Wu, Chongqing Hao, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hunan University(湖南大学) Shanghai AI Lab(上海人工智能实验室) HEBUST

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV、eess.IV、cs.MM

Comments Accepted to NeurIPS 2025. The dataset and code are available at https://github.com/KPeng9510/HopaDIFF

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01064 2025-09-22 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait

Taekyung Ki, Dongchan Min, Gyeongsu Chae

机构 * KAIST(韩国科学技术院) DeepBrain AI Inc.(DeepBrain AI公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM

Comments ICCV 2025. Project page: https://deepbrainai-research.github.io/float/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09089 2025-05-16 cs.LG 67%

Generating time-consistent dynamics with discriminator-guided image diffusion models

Philipp Hess, Maximilian Gelbrecht, Christof Schötz, Michael Aich, Yu Huang, Shangshang Yang, Niklas Boers

机构 * Technical University of Munich(慕尼黑技术大学) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13357 2024-05-24 cs.HC 67%

Enhanced Creativity and Ideation through Stable Video Synthesis

Elijah Miller, Thomas Dupont, Mingming Wang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

Comments short version (working in progress)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 62%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22772 2026-07-28 eess.IV cs.CV 新提交 62%

Generative Video Compression with Adaptive Score Distillation

基于自适应分数蒸馏的生成式视频压缩

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 62%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01615 2026-06-02 cs.CV cs.MM 62%

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

图灵模式用于多媒体:反应-扩散多模态融合用于语言引导的视频时刻检索

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video-language(abstract);分类 cs.CV、cs.MM

AI总结 提出基于反应-扩散过程的多模态融合框架RDMF,通过模拟生物模式形成机制实现视频与文本的动态对齐,用于视频时刻检索与高亮检测。

Comments Published in ACM MM 2025. Address some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14580 2026-04-17 cs.CV cs.MM cs.SD 62%

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation

TurboTalk: 一步生成音频驱动的虚拟角色的渐进蒸馏

Xiangyu Liu, Feng Gao, Xiaomei Zhang, Yong Zhang, Xiaoming Wei, Zhen Lei, Xiangyu Zhu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) The Hong Kong Polytechnic University(香港理工大学) CAIR, HKISI, CAS(中国科学院CAS HKISI CAIR)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TurboTalk框架,通过分布匹配蒸馏和对抗蒸馏逐步压缩多步音频驱动视频扩散模型,实现单步生成高质量虚拟角色,推理速度提升120倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 62%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD 62%

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 62%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 62%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15262 2025-12-18 eess.IV cs.MM 62%

Audio-Visual Cross-Modal Compression for Generative Face Video Coding

音频-视觉跨模态压缩用于生成式面部视频编码

Youmin Xu, Mengxi Guo, Shijie Zhao, Weiqi Li, Junlin Li, Li Zhang, Jian Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM

AI总结 本文提出AVCC框架,通过联合压缩音频和视频流,提升生成式面部视频编码的率-失真性能。

Comments Accepted as a PAPER and for publication in the DCC 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19138 2025-07-28 eess.IV cs.CV 62%

RealisVSR: Detail-enhanced Diffusion for Real-World 4K Video Super-Resolution

Weisong Zhao, Jingkai Zhou, Xiangyu Zhu, Weihua Chen, Xiao-Yu Zhang, Zhen Lei, Fan Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21272 2025-06-30 cs.GR cs.CV cs.MM 62%

FairyGen: Storied Cartoon Video from a Single Child-Drawn Character

Jiayi Zheng, Xiaodong Cun

机构 * GVC Lab, Great Bay University(Great Bay大学GVC实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

Comments Project Page: https://jayleejia.github.io/FairyGen/ ; Code: https://github.com/GVCLab/FairyGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00890 2025-06-03 cs.CV cs.GR eess.IV 62%

Flex3D: Feed-Forward 3D Generation with Flexible Reconstruction Model and Input View Curation

Junlin Han, Jianyuan Wang, Andrea Vedaldi, Philip Torr, Filippos Kokkinos

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

Comments ICML 25. Project page: https://junlinhan.github.io/projects/flex3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17253 2025-04-25 cs.CV cs.MM 62%

DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks

Yinqi Li, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China, and University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院信息处理重点实验室,计算技术研究所,北京,100190,中国,以及中国科学院大学,北京100049,中国)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14226 2025-02-21 cs.CV eess.IV 62%

Designing Parameter and Compute Efficient Diffusion Transformers using Distillation

Vignesh Sundaresha

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏