arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2507.13224 2025-07-18 cs.CV 70%

Leveraging Pre-Trained Visual Models for AI-Generated Video Detection

Keerthi Veeramachaneni, Praveen Tirupattur, Amrit Singh Bedi, Mubarak Shah

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11647 2025-07-10 cs.CV 70%

ReCamMaster: Camera-Controlled Generative Rendering from A Single Video

Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, Di Zhang

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) HUST(华中科技大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://jianhongbai.github.io/ReCamMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20967 2025-06-30 cs.CV cs.AI 70%

DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing

Lingling Cai, Kang Zhao, Hangjie Yuan, Xiang Wang, Yingya Zhang, Kejie Huang

机构 * Zhejiang University(浙江大学) Tongyi Lab(通义实验室) DAMO Academy(达摩院) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Zero-shot video editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18564 2025-06-24 cs.CV 70%

VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning

Xuanyu Zhang, Weiqi Li, Shijie Zhao, Junlin Li, Li Zhang, Jian Zhang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05554 2025-06-09 cs.CV 70%

EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh

Tao Hu, Haoyang Peng, Xiao Liu, Yuewen Ma

机构 * Pico, Bytedance(字节跳动)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04216 2025-06-05 cs.CV 70%

UNIC: Unified In-Context Video Editing

Zixuan Ye, Xuanhua He, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qifeng Chen, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments The project page is at \href{https://zixuan-ye.github.io/UNIC}{https://zixuan-ye.github.io/UNIC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11784 2025-06-05 cs.AI cs.CV cs.LG 70%

Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development

Daoyuan Chen, Haibin Wang, Yilun Huang, Ce Ge, Yaliang Li, Bolin Ding, Jingren Zhou

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Spotlight). 33 pages, 16 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24873 2025-06-02 cs.CV 70%

MiniMax-Remover: Taming Bad Noise Helps Video Object Removal

Bojia Zi, Weixuan Peng, Xianbiao Qi, Jianan Wang, Shihao Zhao, Rong Xiao, Kam-Fai Wong

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00135 2025-05-02 cs.CV 70%

Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis

Michal Geyer, Omer Tov, Linyi Jin, Richard Tucker, Inbar Mosseri, Tali Dekel, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Weizmann Institute of Science(魏茨曼科学研究院) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04471 2025-04-01 cs.CV cs.AI 70%

PaintScene4D: Consistent 4D Scene Generation from Text Prompts

Vinayak Gupta, Yunze Man, Yu-Xiong Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Preprint. Project page: https://paintscene4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21824 2025-03-31 cs.CV cs.CR 70%

Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations

Haitong Liu, Kuofeng Gao, Yang Bai, Jinmin Li, Jinxiao Shan, Tao Dai, Shu-Tao Xia

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19907 2025-03-26 cs.CV 70%

FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qiang Xu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://fulldit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 70%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17048 2025-03-18 cs.CV 70%

PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03758 2025-02-27 cs.CV 70%

ARCON: Advancing Auto-Regressive Continuation for Driving Videos

Ruibo Ming, Jingwei Wu, Zhewei Huang, Zhuoxuan Ju, Jianming HU, Lihui Peng, Shuchang Zhou

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 70%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13190 2025-01-09 cs.CV 70%

MotionBridge: Dynamic Video Inbetweening with Flexible Controls

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Project website: [https://motionbridge.github.io/]

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20404 2024-12-31 cs.CV 70%

Open-Sora: Democratizing Efficient Video Production for All

Zangwei Zheng, Xiangyu Peng, Tianji Yang, Chenhui Shen, Shenggui Li, Hongxin Liu, Yukun Zhou, Tianyi Li, Yang You

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18407 2024-12-05 cs.LG cs.CV 70%

Phased Consistency Models

Fu-Yun Wang, Zhaoyang Huang, Alexander William Bergman, Dazhong Shen, Peng Gao, Michael Lingelbach, Keqiang Sun, Weikang Bian, Guanglu Song, Yu Liu, Xiaogang Wang, Hongsheng Li

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17920 2024-10-16 cs.CV 70%

TC4D: Trajectory-Conditioned Text-to-4D Generation

Sherwin Bahmani, Xian Liu, Wang Yifan, Ivan Skorokhodov, Victor Rong, Ziwei Liu, Xihui Liu, Jeong Joon Park, Sergey Tulyakov, Gordon Wetzstein, Andrea Tagliasacchi, David B. Lindell

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments ECCV 2024; Project Page: https://sherwinbahmani.github.io/tc4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18750 2024-10-14 cs.CV 70%

T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback

Jiachen Li, Weixi Feng, Tsu-Jui Fu, Xinyi Wang, Sugato Basu, Wenhu Chen, William Yang Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://t2v-turbo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07194 2024-10-11 cs.CV cs.AI 70%

Technical Report: Competition Solution For Modelscope-Sora

Shengfu Chen, Hailong Liu, Wenzhao Wei

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14888 2024-09-24 cs.CV 70%

Advancing Video Quality Assessment for AIGC

Xinli Yue, Jianhui Sun, Han Kong, Liangchao Yao, Tianyi Wang, Lei Li, Fengyun Rao, Jing Lv, Fan Xia, Yuetang Deng, Qian Wang, Lingchen Zhao

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10119 2024-08-20 cs.CV cs.AI 70%

Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data

Tao Yang, Yangming Shi, Yunwen Huang, Feng Chen, Yin Zheng, Lei Zhang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08315 2024-08-19 cs.CV cs.AI 70%

Segment Anything for Videos: A Systematic Survey

Chunhui Zhang, Yawen Cui, Weilin Lin, Guanjie Huang, Yan Rong, Li Liu, Shiguang Shan

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments https://github.com/983632847/SAM-for-Videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02216 2024-07-23 cs.GR cs.CV 70%

DragVideo: Interactive Drag-style Video Editing

Yufan Deng, Ruida Wang, Yuhao Zhang, Yu-Wing Tai, Chi-Keung Tang

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17142 2024-06-11 cs.CV cs.GR 70%

DreamGaussian4D: Generative 4D Gaussian Splatting

Jiawei Ren, Liang Pan, Jiaxiang Tang, Chi Zhang, Ang Cao, Gang Zeng, Ziwei Liu

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Technical report. Project page is at https://jiawei-ren.github.io/projects/dreamgaussian4d Code is at https://github.com/jiawei-ren/dreamgaussian4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12605 2024-05-03 cs.CV cs.AI 70%

APLA: Additional Perturbation for Latent Noise with Adversarial Training Enables Consistency

Yupu Yao, Shangqi Deng, Zihan Cao, Harry Zhang, Liang-Jian Deng

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17177 2024-04-19 cs.CV cs.AI cs.LG 70%

Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models

Yixin Liu, Kai Zhang, Yuan Li, Zhiling Yan, Chujie Gao, Ruoxi Chen, Zhengqing Yuan, Yue Huang, Hanchi Sun, Jianfeng Gao, Lifang He, Lichao Sun

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 37 pages, 18 figures; GitHub: https://github.com/lichao-sun/SoraReview

详情

展开后加载摘要…

URL PDF HTML 收藏