arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2508.12880 2026-03-05 cs.CV 70%

Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models

扩散模型训练无关增强的随机自引导

Chubin Chen, Jiashu Zhu, Xiaokun Feng, Nisha Huang, Chen Zhu, Meiqi Wu, Fangyuan Mao, Jiahong Wu, Xiangxiang Chu, Xiu Li

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出S$^2$-Guidance方法,通过随机块丢弃构建子网络,提升扩散模型在文本到图像和视频生成任务中的性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01623 2026-03-03 cs.CV cs.LG 70%

Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration

自适应频谱特征预测用于扩散采样加速

Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Spectrum方法,通过切比雪夫多项式近似实现全局长距离特征重用,提升扩散采样速度并保持高质量样本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11484 2026-03-03 cs.CV 70%

CineTrans: Learning to Generate Videos with Cinematic Transitions via Masked Diffusion Models

CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频

Xiaoxue Wu, Bingjie Gao, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。

Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14377 2026-02-27 cs.CV 70%

RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers

RelaCtrl: 为扩散变换器实现相关性引导的高效控制

Ke Cao, Jing Wang, Ao Ma, Jiasong Feng, Xuanhua He, Run Ling, Haowei Liu, Jian Lu, Wei Feng, Haozhe Wang, Hongjuan Pei, Yihua Shao, Zhanjie Zhang, Jie Zhang

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 RelaCtrl通过相关性引导的方法优化扩散变换器的控制信号整合,减少参数和计算开销,提升生成效率。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06391 2026-02-24 cs.CV 70%

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

Object-WIPER : 无需训练的对象及关联效果视频去除

Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Object-WIPER通过预训练的文本到视频扩散模型实现无需训练的对象及关联效果视频去除,通过创新的去噪方法和新指标在DAVIS和WIPER-Bench上取得优越性能。

Comments Accepted to CVPR 2026. Project Page: https://sakshamsingh1.github.io/object_wiper_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16132 2026-02-19 cs.CV cs.LG 70%

CHAI: CacHe Attention Inference for text2video

CHAI: 文本到视频的缓存注意力推理

Joel Mathew Cherian, Ashutosh Muralidhara Bharadwaj, Vima Gupta, Anand Padmanabha Iyer

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 CHAI通过引入缓存注意力机制,以减少延迟并保持视频质量,实现比OpenSora 1.2快1.65至3.35倍的推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12675 2026-02-16 cs.LG cs.AI cs.CV 70%

SLA2: Sparse-Linear Attention with Learnable Routing and QAT

SLA2: 基于可学习路由和量化感知训练的稀疏-线性注意力

Jintao Zhang, Haoxu Wang, Kai Jiang, Kaiwen Zheng, Youhe Jiang, Ion Stoica, Jianfei Chen, Jun Zhu, Joseph E. Gonzalez

机构 * Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 SLA2通过可学习路由和量化感知训练,提升稀疏-线性注意力的效率和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10102 2026-02-11 cs.CV 70%

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2: 从真实世界视频中学习可迁移的知识

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VideoWorld 2通过动态增强的潜在动态模型从真实世界视频中学习可迁移知识,显著提升了任务成功率和长周期推理能力。

Comments Code and models are released at: https://maverickren.github.io/VideoWorld2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09868 2026-02-11 cs.CV 70%

Free-GVC: Towards Training-Free Extreme Generative Video Compression with Temporal Coherence

Free-GVC: 向无训练极端生成视频压缩迈进:时间一致性

Xiaoyue Ling, Chuqin Zhou, Chunyi Li, Yunuo Chen, Yuan Tian, Guo Lu, Wenjun Zhang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Free-GVC通过无训练的生成视频压缩框架,在超低比特率下实现视觉质量与时间一致性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21091 2026-02-11 cs.CV 70%

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

ERTACache:误差修正与时间步调整以实现高效的扩散模型

Xurui Peng, Chenqian Yan, Hong Liu, Rui Ma, Fangmin Chen, Xing Wang, Zhihua Wu, Songwei Liu, Mingbao Lin

机构 * ByteDance Inc.(字节跳动公司) Rakuten Asia(乐天亚洲)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ERTACache通过误差修正和时间步调整,实现高效扩散模型的加速,保持视觉质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07891 2026-02-02 cs.CV 70%

Video Unlearning via Low-Rank Refusal Vector

通过低秩拒绝向量实现视频去学习

Simone Facchiano, Stefano Saravalle, Matteo Migliarini, Edoardo De Matteis, Alessio Sampieri, Andrea Pilzer, Emanuele Rodolà, Indro Spinelli, Luca Franco, Fabio Galasso

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ItalAI Paradigma NVIDIA

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的视频扩散模型概念去除方法,通过低秩拒绝向量实现安全生成,有效减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10940 2026-01-26 cs.CV cs.AI 70%

OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis

OmniView: 一种用于3D和4D视图合成的全视角扩散模型

Xiang Fan, Sharath Girish, Vivek Ramanujan, Chaoyang Wang, Ashkan Mirzaei, Petr Sushko, Aliaksandr Siarohin, Sergey Tulyakov, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Snap Inc.(Snap公司)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。

Comments Project page: https://snap-research.github.io/OmniView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17907 2025-12-22 cs.CV 70%

Dexterous World Models

灵巧世界模型

Byungjun Kim, Taeksoo Kim, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 灵巧世界模型通过场景-动作-条件的视频扩散框架,实现静态3D场景与灵巧人类动作的动态交互模拟,推动交互式数字双胞胎的发展。

Comments Project Page: snuvclab.github.io/dwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 70%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00227 2025-12-16 cs.CV cs.AI cs.RO 70%

Ctrl-Crash: Controllable Diffusion for Realistic Car Crashes

Ctrl-Crash: 可控扩散用于逼真汽车碰撞

Anthony Gosselin, Ge Ya Luo, Luis Lara, Florian Golemo, Derek Nowrouzezahrai, Liam Paull, Alexia Jolicoeur-Martineau, Christopher Pal

机构 * McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能 chair)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Ctrl-Crash通过可控扩散生成逼真汽车碰撞视频,提升交通安全模拟的可控性和真实性。

Comments Under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05240 2025-12-08 cs.CV 70%

IE2Video: Adapting Pretrained Diffusion Models for Event-Based Video Reconstruction

IE2Video: 适配预训练扩散模型以实现事件视频重建

Dmitrii Torbunov, Onur Okuducu, Yi Huang, Odera Dim, Rebecca Coles, Yonggang Cui, Yihui Ren

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 IE2Video通过适配预训练扩散模型,实现从单帧和事件数据重建RGB视频,提升视频重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23738 2025-11-26 cs.CV cs.GR 70%

How Animals Dance (When You're Not Looking)

动物跳舞(当你不在看的时候)

Xiaojuan Wang, Aleksander Holynski, Brian Curless, Ira Kemelmacher, Steve Seitz

机构 * University of Washington(华盛顿大学) Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 该研究提出了一种生成音乐同步且具有舞蹈意识的动物跳舞视频的框架,通过引入舞蹈模式和图优化问题实现高效舞蹈合成。

Comments Project page: https://how-animals-dance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV 70%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12089 2025-11-19 cs.CV 70%

Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback

Xingpei Ma, Shenneng Huang, Jiaran Cai, Yuansheng Guan, Shen Zheng, Hanfeng Zhao, Qiang Zhang, Shunsi Zhang

机构 * Project lead & Corresponding Author(项目负责人及通讯作者)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12241 2025-11-18 cs.AI cs.CV 70%

AURA: Development and Validation of an Augmented Unplanned Removal Alert System using Synthetic ICU Videos

Junhyuk Seo, Hyeyoon Moon, Kyu-Hwan Jung, Namkee Oh, Taerim Kim

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11062 2025-11-17 cs.CV cs.AI 70%

LiteAttention: A Temporal Sparse Attention for Diffusion Transformers

Dor Shmilovich, Tony Wu, Aviad Dahan, Yuval Domb

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27169 2025-11-03 cs.CV 70%

DANCER: Dance ANimation via Condition Enhancement and Rendering with diffusion model

Yucheng Xing, Jinxing Yin, Xiaodong Liu

机构 * Stony Brook University(石溪大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08325 2025-10-31 cs.CV 70%

GameFactory: Creating New Games with Generative Interactive Videos

Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments ICCV 2025 Highlight, Project Page: https://yujiwen.github.io/gamefactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03621 2025-10-21 cs.CV 70%

DynVFX: Augmenting Real Videos with Dynamic Content

Danah Yatim, Rafail Fridman, Omer Bar-Tal, Tali Dekel

机构 * Weizmann Institute of Science(魏兹曼科学研究所)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://dynvfx.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08530 2025-10-10 cs.GR cs.CV 70%

X2Video: Adapting Diffusion Models for Multimodal Controllable Neural Video Rendering

Zhitong Huang, Mohan Zhang, Renhan Wang, Rui Tang, Hao Zhu, Jing Liao

机构 * City University of Hong Kong(香港城市大学) WeChat, Tencent Inc(微信、腾讯公司) Manycore Tech Inc(很多核科技公司)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Code, model, and dataset will be released at project page soon: https://luckyhzt.github.io/x2video

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24353 2025-09-30 cs.CV 70%

NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis

Yixuan Ren, Hanyu Wang, Hao Chen, Bo He, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: https://nerv-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05827 2025-09-29 cs.CV 70%

Self-Guidance: Boosting Flow and Diffusion Generation on Their Own

Tiancheng Li, Weijian Luo, Zhiyang Chen, Liyuan Ma, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Peking University(北京大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究院先进技术研究所)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20251 2025-09-25 cs.CV 70%

4D Driving Scene Generation With Stereo Forcing

Hao Lu, Zhuang Ma, Guangfeng Jiang, Wenhang Ge, Bohan Li, Yuzhan Cai, Wenzhao Zheng, Yunpeng Zhang, Yingcong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10312 2025-09-15 cs.CV 70%

Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching

Zhixin Zheng, Xinyu Wang, Chang Zou, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Shandong University(山东大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 11 pages, 11 figures; Accepted by ACM MM2025; Mainly focus on feature caching for diffusion transformers acceleration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07472 2025-09-10 cs.CV 70%

ANYPORTAL: Zero-Shot Consistent Video Background Replacement

Wenshuo Gao, Xicheng Lan, Shuai Yang

机构 * Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(王轩计算机技术研究所,多媒体信息处理国家重点实验室,北京大学,北京)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 8 pages, ICCV 2025, Website: https://gaowenshuo.github.io/AnyPortal/

详情

展开后加载摘要…

URL PDF HTML 收藏