arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2412.06016 2025-04-08 cs.CV cs.AI cs.LG 88%

Track4Gen: Teaching Video Diffusion Models to Track Points Improves Video Generation

Hyeonho Jeong, Chun-Hao Paul Huang, Jong Chul Ye, Niloy Mitra, Duygu Ceylan

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments CVPR 2025, Project page: hyeonho99.github.io/track4gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21781 2025-03-28 cs.CV 88%

VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models

Chi-Pin Huang, Yen-Siang Wu, Hung-Kai Chung, Kai-Po Chang, Fu-En Yang, Yu-Chiang Frank Wang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://jasper0314-huang.github.io/videomage-customization

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19369 2025-03-27 cs.CV 88%

EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models

Yufei Cai, Hu Han, Yuxiang Wei, Shiguang Shan, Xilin Chen

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06072 2025-03-27 cs.CV 88%

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, Da Yin, Yuxuan Zhang, Weihan Wang, Yean Cheng, Bin Xu, Xiaotao Gu, Yuxiao Dong, Jie Tang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03847 2025-01-10 cs.CV cs.AI cs.GR 88%

Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control

Zekai Gu, Rui Yan, Jiahao Lu, Peng Li, Zhiyang Dou, Chenyang Si, Zhen Dong, Qifeng Liu, Cheng Lin, Ziwei Liu, Wenping Wang, Yuan Liu

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://igl-hkust.github.io/das/ Codes: https://github.com/IGL-HKUST/DiffusionAsShader

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19645 2024-12-31 cs.CV 88%

VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models

Tao Wu, Yong Zhang, Xiaodong Cun, Zhongang Qi, Junfu Pu, Huanzhang Dou, Guangcong Zheng, Ying Shan, Xi Li

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://wutao-cs.github.io/VideoMaker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14780 2024-08-29 cs.CV 88%

Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models

Yixuan Ren, Yang Zhou, Jimei Yang, Jing Shi, Difan Liu, Feng Liu, Mingi Kwon, Abhinav Shrivastava

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Accepted by ECCV 2024. Project page: https://customize-a-video.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12042 2024-07-09 cs.CV 88%

Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation

Zixin Zhu, Xuelu Feng, Dongdong Chen, Junsong Yuan, Chunming Qiao, Gang Hua

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video understanding(abstract);分类 cs.CV

Comments Appear at ECCV 2024, and the code is available at https://github.com/buxiangzhiren/VD-IT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17414 2024-05-28 cs.CV cs.GR 88%

Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control

Zhengfei Kuang, Shengqu Cai, Hao He, Yinghao Xu, Hongsheng Li, Leonidas Guibas, Gordon Wetzstein

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05519 2024-04-09 cs.CV cs.LG 88%

Investigating the Effectiveness of Cross-Attention to Unlock Zero-Shot Editing of Text-to-Video Diffusion Models

Saman Motamed, Wouter Van Gansbeke, Luc Van Gool

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Generative Models for Computer Vision Generative Models for Computer Vision CVPR 2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13812 2024-03-20 cs.AI cs.CV 88%

Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs

Hao Fei, Shengqiong Wu, Wei Ji, Hanwang Zhang, Tat-Seng Chua

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16933 2023-11-29 cs.CV 88%

SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models

Yuwei Guo, Ceyuan Yang, Anyi Rao, Maneesh Agrawala, Dahua Lin, Bo Dai

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Project page: https://guoyww.github.io/projects/SparseCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03272 2025-11-06 cs.CV 87%

Unified Long Video Inpainting and Outpainting via Overlapping High-Order Co-Denoising

Shuangquan Lyu, Steven Mao, Yue Ma

专题命中 视频扩散模型 :long video(title,abstract);video generation(abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08453 2025-01-16 cs.CV cs.LG 87%

Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models

Weichen Fan, Chenyang Si, Junhao Song, Zhenyu Yang, Yinan He, Long Zhuo, Ziqi Huang, Ziyue Dong, Jingwen He, Dongwei Pan, Yi Wang, Yuming Jiang, Yaohui Wang, Peng Gao, Xinyuan Chen, Hengjie Li, Dahua Lin, Yu Qiao, Ziwei Liu

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);long video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新 86%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI 86%

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title);分类 cs.CV

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20470 2026-04-23 cs.CV 86%

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

动态Rad:面向长视频扩散的内容自适应稀疏注意力

Yongji Long, Shijun Liang, Jintao Li, Yun Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shenzhen Institute for Advanced Study, UESTC(深圳先进研究院) Computational Mathematics, Science, & Engineering at Michigan State University (MSU)(密歇根州立大学计算数学、科学与工程)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title);分类 cs.CV

AI总结 本文提出DynamicRad,通过引入双模式策略和语义运动路由器,实现长视频扩散中的高效稀疏注意力机制,提升推理速度并保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 86%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12691 2026-02-27 cs.GR cs.CV cs.LG 86%

Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration

自适应混合缓存用于高效文本到视频扩散模型加速

Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);video generation(abstract);分类 cs.CV

AI总结 本文提出MixCache,一种基于缓存的训练自由框架,通过自适应混合缓存策略提升视频DiT模型的生成效率和质量。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17550 2025-09-30 cs.CV 86%

T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models

Xiaoyu Ye, Songjie Cheng, Yongtao Wang, Yajiao Xiong, Yishen Li

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15314 2025-08-28 cs.CV cs.AI cs.CR 86%

VideoEraser: Concept Erasure in Text-to-Video Diffusion Models

Naen Xu, Jinghuai Zhang, Changjiang Li, Zhi Chen, Chunyi Zhou, Qingming Li, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

Comments To appear in the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17550 2025-04-10 cs.LG cs.MM cs.SD eess.AS 86%

A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation

Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title);分类 cs.MM

Comments IJCNN 2025. The source code is available: https://github.com/SonyResearch/SVG_baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19881 2025-03-26 cs.CV 86%

Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation

Tianhao Qi, Jianlong Yuan, Wanquan Feng, Shancheng Fang, Jiawei Liu, SiYu Zhou, Qian He, Hongtao Xie, Yongdong Zhang

专题命中 视频扩散模型 :video generation(title,abstract);long video(title);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13234 2025-02-20 cs.CV cs.AI cs.LG 86%

MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching

Yen-Siang Wu, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

Comments Project page: https://www.csie.ntu.edu.tw/~b09902097/motionmatcher/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13405 2026-03-17 cs.CV eess.IV 86%

Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion

锚点强制:用于交互式流视频扩散的锚点记忆与三区域RoPE

Yang Yang, Tianyi Zhang, Wei Huang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo BlueImage Lab(vivo蓝影实验室) University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 本文提出锚点强制框架,通过锚点引导重置缓存和三区域RoPE解决交互式流视频生成中的质量退化和运动动态减弱问题,提升感知质量和运动指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18375 2025-08-06 cs.CV eess.IV 86%

Individual Content and Motion Dynamics Preserved Pruning for Video Diffusion Models

Yiming Wu, Zhenghao Chen, Huan Wang, Dong Xu

机构 * The University of Hong Kong(香港大学) University of Newcastle(新castle大学) Westlake University(西湖大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15156 2024-12-20 cs.CV cs.CL cs.MM 86%

Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM

Yatai Ji, Jiacheng Zhang, Jie Wu, Shilong Zhang, Shoufa Chen, Chongjian GE, Peize Sun, Weifeng Chen, Wenqi Shao, Xuefeng Xiao, Weilin Huang, Ping Luo

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17005 2024-03-26 cs.CV cs.MM 86%

TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models

Zhongwei Zhang, Fuchen Long, Yingwei Pan, Zhaofan Qiu, Ting Yao, Yang Cao, Tao Mei

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments CVPR 2024; Project page: https://trip-i2v.github.io/TRIP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12490 2023-12-21 cs.CV cs.AI cs.LG cs.MM 86%

InstructVideo: Instructing Video Diffusion Models with Human Feedback

Hangjie Yuan, Shiwei Zhang, Xiang Wang, Yujie Wei, Tao Feng, Yining Pan, Yingya Zhang, Ziwei Liu, Samuel Albanie, Dong Ni

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Project page: https://instructvideo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17985 2025-09-23 cs.GR 86%

VideoFrom3D: 3D Scene Video Generation via Complementary Image and Video Diffusion Models

Geonung Kim, Janghyeok Han, Sunghyun Cho

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(title)

Comments Project page: https://kimgeonung.github.io/VideoFrom3D/

详情

展开后加载摘要…

URL PDF HTML 收藏