arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2205.11495 2022-12-19 cs.CV cs.LG 79%

Flexible Diffusion Modeling of Long Videos

William Harvey, Saeid Naderiparizi, Vaden Masrani, Christian Weilbach, Frank Wood

专题命中 视频扩散模型 :long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09481 2022-12-09 cs.CV cs.LG stat.ML 79%

Diffusion Probabilistic Modeling for Video Generation

Ruihan Yang, Prakhar Srivastava, Stephan Mandt

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09853 2022-10-14 cs.CV cs.AI cs.LG 79%

MCVD: Masked Conditional Video Diffusion for Prediction, Generation, and Interpolation

Vikram Voleti, Alexia Jolicoeur-Martineau, Christopher Pal

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments NeurIPS 2022 ; 10 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03458 2022-06-24 cs.CV cs.AI cs.LG 79%

Video Diffusion Models

Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, David J. Fleet

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09414 2024-01-18 cs.CV cs.AI cs.LG cs.MM 79%

Vlogger: Make Your Dream A Vlog

Shaobin Zhuang, Kunchang Li, Xinyuan Chen, Yaohui Wang, Ziwei Liu, Yu Qiao, Yali Wang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV、cs.MM

Comments 16 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14908 2026-07-17 cs.AR cs.DC 新提交 78%

CODA: Algorithm-Hardware Co-design for Edge Video Diffusion via NMP-Enabled Compute-Cache Operator Disaggregation

CODA:通过启用NMP的计算-缓存算子分解实现边缘视频扩散的算法-硬件协同设计

Yuanpeng Zhang, YuXuan Wu, Yitong Xiao, Chenhao Xue, Yi Ren, Cong Li, Yihan Yin, Dimin Niu, Guangyu Sun

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 研究在边缘设备部署视频扩散模型时速度慢的问题,提出CODA架构,通过计算-缓存算子分解,分离计算与缓存路径、重组缓存活动并利用分支独立性,实现端到端加速和能源效率提升,且保持生成质量。

Comments 15 pages, 14 figures, accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13770 2026-07-16 cs.AR cs.AI 新提交 78%

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计

Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) Huawei Technologies(华为技术有限公司) ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00961 2026-04-06 cs.LG 78%

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO 78%

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15627 2026-03-18 cs.GR cs.CE physics.comp-ph physics.flu-dyn 78%

Physics-Informed Video Diffusion For Shallow Water Equations

基于物理的视频扩散用于浅水方程

Yang Bai, George Eskandar, Ziyuan Liu, Gitta Kutyniok

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。

Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17661 2025-12-22 cs.RO cs.LG 78%

Vidarc: Embodied Video Diffusion Model for Closed-loop Control

Vidarc:用于闭环控制的具身视频扩散模型

Yao Feng, Chendong Xiang, Xinyi Mao, Hengkai Tan, Zuyue Zhang, Shuhe Huang, Kaiwen Zheng, Haitian Liu, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交 77%

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17120 2026-07-21 cs.CV 新提交 77%

The generator is the tracker: Multi-object tracking by painting persistent identity colours

生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪

Haiyu Yang, Miel Hostens

机构 * Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14898 2026-07-17 cs.CV cs.AI 新提交 77%

FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers

FlashDecoder:基于Transformer的实时潜空间到像素流解码器

Minguk Kang, Suha Kwak

机构 * Pika Labs(皮卡实验室) POSTECH(浦项科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对实时视频生成中潜视频扩散模型解码慢、内存占用大的问题,提出FlashDecoder,一种基于Transformer的纯视频解码器,通过滚动KV缓存和顺序处理帧实现快速解码,在重建质量匹配卷积解码器的同时大幅提升速度并减少内存占用。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23610 2026-06-23 cs.CV 新提交 77%

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

Vera: 一种用于内容保持视频编辑的分层扩散模型

Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan

机构 * California Institute of Technology(加州理工学院) Netflix, Inc(Netflix公司)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。

Comments https://vera-layered-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15458 2026-05-18 cs.CV 77%

Video Models Can Reason with Verifiable Rewards

视频模型可以借助可验证的奖励进行推理

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。

Comments Website: https://darthzhu.github.io/VideoRLVR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 77%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19840 2026-04-20 cs.CV 77%

GenHSI: Controllable Generation of Human-Scene Interaction Videos

GenHSI: 可控生成人类-场景交互视频

Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 GenHSI提出一种无需训练的可控生成长人类-场景交互视频方法,通过剧本写作、预可视化和动画三阶段生成3D-aware视频,保留人物身份并提供合理交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 77%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04698 2025-05-14 cs.CV 77%

ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning

Yuzhou Huang, Ziyang Yuan, Quande Liu, Qiulin Wang, Xintao Wang, Ruimao Zhang, Pengfei Wan, Di Zhang, Kun Gai

机构 * Sun Yat-sen University(中山大学) Kuaishou Technology(快手科技) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://yuzhou914.github.io/ConceptMaster/. Update and release MCVC Evaluation Set

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10678 2025-03-17 cs.CV 77%

VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion

Lehan Yang, Jincen Song, Tianlong Wang, Daiqing Qi, Weili Shi, Yuheng Liu, Sheng Li

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05651 2025-03-04 cs.CV cs.AI cs.LG 77%

ViBiDSampler: Enhancing Video Interpolation Using Bidirectional Diffusion Sampler

Serin Yang, Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments ICLR 2025; Project page: https://vibidsampler.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15249 2024-12-20 cs.CV cs.AI cs.LG 77%

Spectral Motion Alignment for Video Motion Transfer using Diffusion Models

Geon Yeong Park, Hyeonho Jeong, Sang Wan Lee, Jong Chul Ye

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments AAAI 2025, Project page: https://geonyeong-park.github.io/spectral-motion-alignment/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04432 2024-12-06 cs.CV 77%

Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation

Yuying Ge, Yizhuo Li, Yixiao Ge, Ying Shan

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project released at: https://github.com/TencentARC/Divot

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11473 2024-11-05 cs.CV cs.AI 77%

FIFO-Diffusion: Generating Infinite Videos from Text without Training

Jihwan Kim, Junoh Kang, Jinyoung Choi, Bohyung Han

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Project Page: https://jjihwan.github.io/projects/FIFO-Diffusion

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07685 2023-03-31 cs.CV cs.LG 77%

Video Probabilistic Diffusion Models in Projected Latent Space

Sihyun Yu, Kihyuk Sohn, Subin Kim, Jinwoo Shin

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://sihyun.me/PVDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01700 2026-07-21 cs.CV cs.MM 版本更新 76%

Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation

视频扩散模型能否预测过去帧?双向循环一致性用于可逆插值

Lingyu Liu, Yaxiong Wang, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) School of Computer and Information Science, Hefei University of Technology(合肥工业大学计算机与信息科学学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出双向循环一致性框架,通过双向生成轨迹对称性提升视频插值的时序一致性,实验表明在37帧和73帧任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11289 2026-03-24 cs.CV cs.MM 76%

UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer

UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画

Xiang Wang, Shiwei Zhang, Longxiang Tang, Yingya Zhang, Changxin Gao, Yuehuan Wang, Nong Sang

机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM

AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。

Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13967 2026-03-17 eess.IV cs.AI cs.CV 76%

EchoLVFM: One-Step Video Generation via Latent Flow Matching for Echocardiogram Synthesis

EchoLVFM: 通过潜在流匹配实现单步视频生成用于超声心动图合成

Emmanuel Oladokun, Sarina Thomas, Jurica Šprem, Vicente Grau

专题命中 视频扩散模型 :video generation(title);分类 cs.CV、eess.IV

AI总结 本文提出EchoLVFM框架,通过潜在空间单步生成可控的超声心动图视频,提升效率并保持视觉质量,实验证明其在单帧条件下的视频质量与专家判断准确率。

Comments Submitted to MICCAI 2026; Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17842 2025-02-26 cs.CV cs.LG cs.MM cs.SD eess.AS 76%

MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji

专题命中 视频扩散模型 :video generation(title);分类 cs.CV、cs.MM

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏