arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2312.00845 2023-12-05 cs.CV cs.AI cs.LG 89%

VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion Models

Hyeonho Jeong, Geon Yeong Park, Jong Chul Ye

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: https://video-motion-customization.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20700 2023-11-07 cs.CV 89%

SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction

Xinyuan Chen, Yaohui Wang, Lingjun Zhang, Shaobin Zhuang, Xin Ma, Jiashuo Yu, Yali Wang, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/SEINE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08465 2023-10-13 cs.CV 89%

MotionDirector: Motion Customization of Text-to-Video Diffusion Models

Rui Zhao, Yuchao Gu, Jay Zhangjie Wu, David Junhao Zhang, Jiawei Liu, Weijia Wu, Jussi Keppo, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project Page: https://showlab.github.io/MotionDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18264 2023-05-30 cs.CV 89%

Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Fu-Yun Wang, Wenshuo Chen, Guanglu Song, Han-Jia Ye, Yu Liu, Hongsheng Li

专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments The code is available at https://github.com/G-U-N/Gen-L-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交 88%

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title);video generation(abstract);分类 cs.CV

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26706 2026-07-30 cs.CV 新提交 88%

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

TPD:用于文本到视频扩散模型的时间先验解耦

Taewon Kang, Matthias Zwicker

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00957 2026-06-02 cs.CV 88%

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化

Yiming Zhao

机构 * Yiming Zhao(赵毅铭)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。

Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31057 2026-06-01 cs.CV cs.LG 88%

LVSA: Training-Free Sparse Attention for Long Video Diffusion

LVSA:长视频扩散的无训练稀疏注意力

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

机构 * Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France(华为法国巴黎研究中心分布式并行技术实验室) AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能框架与数据技术实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出一种无需训练、模型无关的块稀疏注意力方法LVSA,通过结构化窗口模式与旋转全局锚点结合,在降低长视频扩散推理计算成本的同时消除固定网格偏差,支持超训练时域的视频生成。

Comments 10 pages, 5 figures, 4 tables. Code: https://github.com/JiusiServe/LongVideoSparseAttention

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25941 2026-05-26 cs.CV 88%

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV 88%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19381 2026-02-27 cs.CV cs.GR 88%

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20791 2026-01-29 cs.CV cs.AI 88%

FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models

FAIRT2V:无需训练的文本到视频扩散模型去偏框架

Haonan Zhong, Wei Song, Tingxu Han, Maurice Pagnucco, Jingling Xue, Yang Song

机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22622 2025-12-05 cs.CV 88%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16714 2025-09-09 cs.CV cs.AI 88%

Separate Motion from Appearance: Customizing Motion via Customizing Text-to-Video Diffusion Models

Huijie Liu, Jingyun Wang, Shuai Ma, Jie Hu, Xiaoming Wei, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 8 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13584 2025-08-20 cs.CV 88%

Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model

Ruixin Zhang, Jiaqing Fan, Yifan Liao, Qian Qiao, Fanzhang Li

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00289 2025-08-04 cs.CV 88%

TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models

Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06016 2025-04-08 cs.CV cs.AI cs.LG 88%

Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation

Hyeonho Jeong, Chun-Hao Paul Huang, Jong Chul Ye, Niloy Mitra, Duygu Ceylan

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments CVPR 2025, Project page: hyeonho99.github.io/track4gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21781 2025-03-28 cs.CV 88%

VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models

Chi-Pin Huang, Yen-Siang Wu, Hung-Kai Chung, Kai-Po Chang, Fu-En Yang, Yu-Chiang Frank Wang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://jasper0314-huang.github.io/videomage-customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19369 2025-03-27 cs.CV 88%

EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models

Yufei Cai, Hu Han, Yuxiang Wei, Shiguang Shan, Xilin Chen

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06072 2025-03-27 cs.CV 88%

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, Da Yin, Yuxuan Zhang, Weihan Wang, Yean Cheng, Bin Xu, Xiaotao Gu, Yuxiao Dong, Jie Tang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03847 2025-01-10 cs.CV cs.AI cs.GR 88%

Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control

Zekai Gu, Rui Yan, Jiahao Lu, Peng Li, Zhiyang Dou, Chenyang Si, Zhen Dong, Qifeng Liu, Cheng Lin, Ziwei Liu, Wenping Wang, Yuan Liu

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://igl-hkust.github.io/das/ Codes: https://github.com/IGL-HKUST/DiffusionAsShader

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19645 2024-12-31 cs.CV 88%

VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models

Tao Wu, Yong Zhang, Xiaodong Cun, Zhongang Qi, Junfu Pu, Huanzhang Dou, Guangcong Zheng, Ying Shan, Xi Li

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://wutao-cs.github.io/VideoMaker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14780 2024-08-29 cs.CV 88%

Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models

Yixuan Ren, Yang Zhou, Jimei Yang, Jing Shi, Difan Liu, Feng Liu, Mingi Kwon, Abhinav Shrivastava

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Accepted by ECCV 2024. Project page: https://customize-a-video.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12042 2024-07-09 cs.CV 88%

Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation

Zixin Zhu, Xuelu Feng, Dongdong Chen, Junsong Yuan, Chunming Qiao, Gang Hua

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video understanding(abstract);分类 cs.CV

Comments Appear at ECCV 2024, and the code is available at https://github.com/buxiangzhiren/VD-IT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17414 2024-05-28 cs.CV cs.GR 88%

Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control

Zhengfei Kuang, Shengqu Cai, Hao He, Yinghao Xu, Hongsheng Li, Leonidas Guibas, Gordon Wetzstein

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05519 2024-04-09 cs.CV cs.LG 88%

Investigating the Effectiveness of Cross-Attention to Unlock Zero-Shot Editing of Text-to-Video Diffusion Models

Saman Motamed, Wouter Van Gansbeke, Luc Van Gool

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Generative Models for Computer Vision Generative Models for Computer Vision CVPR 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13812 2024-03-20 cs.AI cs.CV 88%

Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs

Hao Fei, Shengqiong Wu, Wei Ji, Hanwang Zhang, Tat-Seng Chua

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16933 2023-11-29 cs.CV 88%

SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models

Yuwei Guo, Ceyuan Yang, Anyi Rao, Maneesh Agrawala, Dahua Lin, Bo Dai

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Project page: https://guoyww.github.io/projects/SparseCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03272 2025-11-06 cs.CV 87%

Unified Long Video Inpainting and Outpainting via Overlapping High-Order Co-Denoising

Shuangquan Lyu, Steven Mao, Yue Ma

专题命中 视频扩散模型 :long video(title,abstract);video generation(abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08453 2025-01-16 cs.CV cs.LG 87%

Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models

Weichen Fan, Chenyang Si, Junhao Song, Zhenyu Yang, Yinan He, Long Zhuo, Ziqi Huang, Ziyue Dong, Jingwen He, Dongwei Pan, Yi Wang, Yuming Jiang, Yaohui Wang, Peng Gao, Xinyuan Chen, Hengjie Li, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);long video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏