arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2211.13221 2023-03-21 cs.CV cs.AI 92%

Latent Video Diffusion Models for High-Fidelity Long Video Generation

Yingqing He, Tianyu Yang, Yong Zhang, Ying Shan, Qifeng Chen

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);long video(title,abstract);text-to-video(abstract)

Comments Project Page: https://yingqinghe.github.io/LVDM/ Github: https://github.com/YingqingHe/LVDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 92%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(title);video understanding(abstract)

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09019 2025-01-16 cs.CV 90%

Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion

Jingyuan Chen, Fuchen Long, Jie An, Zhaofan Qiu, Ting Yao, Jiebo Luo, Tao Mei

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01316 2025-04-01 cs.CV cs.AI cs.MM 90%

Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation

Xin Yan, Yuxuan Cai, Qiuyue Wang, Yuan Zhou, Wenhao Huang, Huan Yang

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

Comments This paper is accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13840 2024-08-13 cs.CV cs.AI cs.LG cs.MM 90%

Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning

Weifeng Chen, Yatai Ji, Jie Wu, Hefeng Wu, Pan Xie, Jiashi Li, Xin Xia, Xuefeng Xiao, Liang Lin

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00194 2026-03-03 cs.CV cs.AI cs.CR 89%

SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models

SKeDA:一种面向文本到视频扩散模型的生成水印框架

Yang Yang, Xinze Zou, Zehua Ma, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Anhui Province Key Laboratory of Digital Security and the CAS Key Laboratory of Electromagnetic Space Information, University of Science and Technology of China(安徽省数字安全重点实验室和中国科学院电磁空间信息重点实验室,中国科学技术大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SKeDA是一种专为文本到视频扩散模型设计的生成水印框架,通过分布保持采样和差分注意机制提升水印的鲁棒性和可靠性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 89%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14209 2025-08-29 cs.LG cs.CV 89%

Unlearning Concepts from Text-to-Video Diffusion Models

Shiqi Liu, Yihua Tan

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05484 2025-01-13 cs.CV 89%

Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion

Yongjia Ma, Junlin Chen, Donglin Di, Qi Xie, Lei Fan, Wei Chen, Xiaofei Gou, Na Zhao, Xun Yang

专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02332 2024-11-12 cs.CV 89%

UniCtrl: Improving the Spatiotemporal Consistency of Text-to-Video Diffusion Models via Training-Free Unified Attention Control

Tian Xia, Xuweiyi Chen, Sihan Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted to TMLR | Project Page: https://unified-attention-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06098 2024-10-01 cs.CV cs.CL 89%

VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models

Wenhao Wang, Yi Yang

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05082 2024-06-10 cs.CV 89%

CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion

Xingrui Wang, Xin Li, Zhibo Chen

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06578 2024-05-13 cs.CV 89%

360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model

Qian Wang, Weiqi Li, Chong Mou, Xinhua Cheng, Jian Zhang

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2307.04725 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16306 2024-04-26 cs.CV 89%

TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models

Haomiao Ni, Bernhard Egger, Suhas Lohit, Anoop Cherian, Ye Wang, Toshiaki Koike-Akino, Sharon X. Huang, Tim K. Marks

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);long video(abstract)

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00845 2023-12-05 cs.CV cs.AI cs.LG 89%

VMC: Video Motion Customization using Temporal Attention Adaption for Text-to-Video Diffusion Models

Hyeonho Jeong, Geon Yeong Park, Jong Chul Ye

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: https://video-motion-customization.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20700 2023-11-07 cs.CV 89%

SEINE: Short-to-Long Video Diffusion Model for Generative Transition and Prediction

Xinyuan Chen, Yaohui Wang, Lingjun Zhang, Shaobin Zhuang, Xin Ma, Jiashuo Yu, Yali Wang, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/SEINE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08465 2023-10-13 cs.CV 89%

MotionDirector: Motion Customization of Text-to-Video Diffusion Models

Rui Zhao, Yuchao Gu, Jay Zhangjie Wu, David Junhao Zhang, Jiawei Liu, Weijia Wu, Jussi Keppo, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project Page: https://showlab.github.io/MotionDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18264 2023-05-30 cs.CV 89%

Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising

Fu-Yun Wang, Wenshuo Chen, Guanglu Song, Han-Jia Ye, Yu Liu, Hongsheng Li

专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments The code is available at https://github.com/G-U-N/Gen-L-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交 88%

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title);video generation(abstract);分类 cs.CV

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26706 2026-07-30 cs.CV 新提交 88%

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

TPD:用于文本到视频扩散模型的时间先验解耦

Taewon Kang, Matthias Zwicker

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 该研究针对文本到视频扩散模型的时间先验抑制问题,提出无需训练的TPD框架,通过帧选择性下界约束恢复被抑制的后期片段信号,提升后期概念实现效果且与骨干无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00957 2026-06-02 cs.CV 88%

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

面向大规模文生视频扩散Transformer的边界保护W8A8 HiFloat8量化

Yiming Zhao

机构 * Yiming Zhao(赵毅铭)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对Wan2.1-T2V-14B模型,提出一种边界保护策略的W8A8 HiF8后训练量化方法,通过保留首尾边界块为BF16而量化中间块,在VBench五个维度上匹配或略优于BF16基线。

Comments 6 pages, 5 figures. Accepted to ICME 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31057 2026-06-01 cs.CV cs.LG 88%

LVSA: Training-Free Sparse Attention for Long Video Diffusion

LVSA:长视频扩散的无训练稀疏注意力

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

机构 * Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France(华为法国巴黎研究中心分布式并行技术实验室) AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人工智能框架与数据技术实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出一种无需训练、模型无关的块稀疏注意力方法LVSA,通过结构化窗口模式与旋转全局锚点结合,在降低长视频扩散推理计算成本的同时消除固定网格偏差,支持超训练时域的视频生成。

Comments 10 pages, 5 figures, 4 tables. Code: https://github.com/JiusiServe/LongVideoSparseAttention

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25941 2026-05-26 cs.CV 88%

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV 88%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19381 2026-02-27 cs.CV cs.GR 88%

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20791 2026-01-29 cs.CV cs.AI 88%

FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models

FAIRT2V:无需训练的文本到视频扩散模型去偏框架

Haonan Zhong, Wei Song, Tingxu Han, Maurice Pagnucco, Jingling Xue, Yang Song

机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22622 2025-12-05 cs.CV 88%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16714 2025-09-09 cs.CV cs.AI 88%

Separate Motion from Appearance: Customizing Motion via Customizing Text-to-Video Diffusion Models

Huijie Liu, Jingyun Wang, Shuai Ma, Jie Hu, Xiaoming Wei, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 8 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13584 2025-08-20 cs.CV 88%

Temporal-Conditional Referring Video Object Segmentation with Noise-Free Text-to-Video Diffusion Model

Ruixin Zhang, Jiaqing Fan, Yifan Liao, Qian Qiao, Fanzhang Li

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00289 2025-08-04 cs.CV 88%

TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models

Christian Simon, Masato Ishii, Akio Hayakawa, Zhi Zhong, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏