arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6765 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2511.12371 2025-11-18 cs.CV 79%

Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models

Yiqing Shen, Chenxiao Fan, Chenjia Li, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10202 2025-11-17 cs.CL cs.CV 79%

Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval

Shubhashis Roy Dipta, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering University of Maryland Baltimore County(计算机科学与电气工程系马里兰大学巴尔的摩县)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted in IJCNLP-AACL 2025 (also presented in MAGMAR 2025 at ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01450 2025-11-11 cs.CV cs.AI 79%

Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation

Jie Du, Xinyu Gong, Qingshan Tan, Wen Li, Yangming Cheng, Weitao Wang, Chenlu Zhan, Suhui Wu, Hao Zhang, Jun Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments The paper is withdrawn due to the need for further revision and verification of experimental results. A revised version will be resubmitted once the updates are completed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20358 2025-11-11 cs.CV 79%

PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

Chen Wang, Chuhao Chen, Yiming Huang, Zhiyang Dou, Yuan Liu, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09045 2025-11-06 cs.CV 79%

MagCache: Fast Video Generation with Magnitude-Aware Cache

Zehong Ma, Longhui Wei, Feng Wang, Shiliang Zhang, Qi Tian

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Huawei Inc.(华为公司)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments Project Page: https://zehong-ma.github.io/MagCache Accepted by NeurIPS 2025

Journal ref In Proceedings of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00107 2025-11-04 cs.CV cs.AI cs.IR 79%

AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24717 2025-10-29 cs.CV 79%

Uniform Discrete Diffusion with Metric Path for Video Generation

Haoge Deng, Ting Pan, Fan Zhang, Yang Liu, Zhuoyan Luo, Yufeng Cui, Wenxuan Wang, Chunhua Shen, Shiguang Shan, Zhaoxiang Zhang, Xinlong Wang

机构 * National Laboratory of Pattern Recognition, CASIA(中国科学院自动化所模式识别国家实验室) Key Laboratory of Intelligent Information Processing, ICT, CAS(中国科学院信息科技重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13918 2025-10-28 cs.CV cs.AI cs.GR cs.LG 79%

Improving Video Generation with Human Feedback

Jie Liu, Gongye Liu, Jiajun Liang, Ziyang Yuan, Xiaokun Liu, Mingwu Zheng, Xiele Wu, Qiulin Wang, Menghan Xia, Xintao Wang, Xiaohong Liu, Fei Yang, Pengfei Wan, Di Zhang, Kun Gai, Yujiu Yang, Wanli Ouyang

机构 * MMLab, CUHK(CUHK媒体实验室) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments https://github.com/KwaiVGI/VideoAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11224 2025-10-24 cs.CV cs.GR 79%

GenLit: Reformulating Single-Image Relighting as Video Generation

Shrisha Bharadwaj, Haiwen Feng, Giorgio Becherini, Victoria Fernandez Abrevaya, Michael J. Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17519 2025-10-23 cs.CV cs.AI 79%

MUG-V 10B: High-efficiency Training Pipeline for Large Video Generation Models

Yongshun Zhang, Zhongyi Fan, Yonghang Zhang, Zhangzikang Li, Weifeng Chen, Zhongwei Feng, Chaoyue Wang, Peng Hou, Anxiang Zeng

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Technical Report; Project Page: https://github.com/Shopee-MUG/MUG-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14847 2025-10-23 cs.CV 79%

ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic Dependency Constraints

Meiqi Wu, Jiashu Zhu, Xiaokun Feng, Chubin Chen, Chen Zhu, Bingze Song, Fangyuan Mao, Jiahong Wu, Xiangxiang Chu, Kaiqi Huang

机构 * UCAS(中国科学院大学) AMAP, Alibaba Group(阿里云实验室) CRISE(中国科学院计算技术研究所) THU(清华大学) SEU(上海电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18775 2025-10-22 cs.CV 79%

UltraGen: High-Resolution Video Generation with Hierarchical Attention

Teng Hu, Jiangning Zhang, Zihan Su, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16833 2025-10-21 cs.CV cs.GR 79%

From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display

Xiangyu Mu, Dongliang Zhou, Jie Hou, Haijun Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14588 2025-10-21 cs.CV cs.AI 79%

STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding

Zhifei Chen, Tianshuo Xu, Leyi Wu, Luozhou Wang, Dongyu Yan, Zihan You, Wenting Luo, Guo Zhang, Yingcong Chen

机构 * HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) XMU(厦门大学) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Code, model, and demos can be found at https://envision-research.github.io/STANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 79%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13809 2025-10-16 cs.CV 79%

PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning

Sihui Ji, Xi Chen, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://sihuiji.github.io/PhysMaster-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08527 2025-10-10 cs.CV 79%

FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control

Zhiyuan Zhang, Can Wang, Dongdong Chen, Jing Liao

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Microsoft GenAI(微软生成人工智能)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://bestzzhang.github.io/FlexTraj

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23742 2025-10-10 cs.CV cs.AI 79%

MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement

Yufan Deng, Yuanyang Yin, Xun Guo, Yizhi Wang, Jacob Zhiyuan Fang, Shenghai Yuan, Yiding Yang, Angtian Wang, Bo Liu, Haibin Huang, Chongyang Ma

机构 * Intelligent Creation ByteDance(智能创作字节跳动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Code: https://github.com/MAGREF-Video/MAGREF/; Project website: https://magref-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06209 2025-10-08 cs.CV 79%

Drive&Gen: Co-Evaluating End-to-End Driving and Video Generation Models

Jiahao Wang, Zhenpei Yang, Yijing Bai, Yingwei Li, Yuliang Zou, Bo Sun, Abhijit Kundu, Jose Lezama, Luna Yue Huang, Zehao Zhu, Jyh-Jing Hwang, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Johns Hopkins University(约翰霍普金斯大学) Waymo Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04999 2025-10-07 cs.GR cs.AI cs.CV 79%

Bridging Text and Video Generation: A Survey

Nilay Kumar, Priyansh Bhandari, G. Maragatham

机构 * Department of Computational Intelligence(计算智能系) SRM Institute of Science and Technology(SRM科学与技术学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02690 2025-10-07 cs.CV cs.AI cs.LG 79%

Controllable Video Generation with Provable Disentanglement

Yifan Shen, Peiyuan Zhu, Zijian Li, Shaoan Xie, Namrata Deka, Zongfang Liu, Zeyu Tang, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01784 2025-10-06 cs.CV cs.AI 79%

Pack and Force Your Memory: Long-form and Consistent Video Generation

Xiaofei Wu, Guozhen Zhang, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯文言) Nanjing University(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08316 2025-10-03 cs.CV cs.AI cs.LG 79%

Diffusion Adversarial Post-Training for One-Step Video Generation

Shanchuan Lin, Xin Xia, Yuxi Ren, Ceyuan Yang, Xuefeng Xiao, Lu Jiang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00806 2025-10-02 cs.CV 79%

From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation

Fan Yang, Zhiyang Chen, Yousong Zhu, Xin Li, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心、自动化研究所、中国科学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室、深圳中国) School of Artificial Intelligence, University of Chinese Academy of Science, Beijing, China(人工智能学院、中国科学院大学、北京中国) Wuhan AI Research, Wuhan, China(武汉人工智能研究、武汉中国) MAPLE Lab, Westlake University(MAPLE实验室、西湖大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24241 2025-09-30 cs.CV cs.RO 79%

FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation

Seungwook Kim, Seunghyeon Lee, Minsu Cho

机构 * POSTECH Ewha Womans University(成均馆大学) RLWRLD

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 8 pages, 4 figures, accepted to CoRL 2025 LSRW workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24081 2025-09-30 cs.CV 79%

Autoregressive Video Generation beyond Next Frames Prediction

Sucheng Ren, Chen Chen, Zhenbang Wang, Liangchen Song, Xiangxin Zhu, Alan Yuille, Yinfei Yang, Jiasen Lu

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14899 2025-09-23 cs.CV 79%

Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation

Chenjie Cao, Jingkai Zhou, Shikai Li, Jingyun Liang, Chaohui Yu, Fan Wang, Xiangyang Xue, Yanwei Fu

机构 * Alibaba DAMO Academy(阿里巴巴达摩院) Fudan University(复旦大学) Hupan Lab(虎扑实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://github.com/ewrfcas/Uni3C. Accepted by Siggraph Asian 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15496 2025-09-22 cs.CV 79%

Lynx: Towards High-Fidelity Personalized Video Generation

Shen Sang, Tiancheng Zhi, Tianpei Gu, Jing Liu, Linjie Luo

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Lynx Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15479 2025-09-22 cs.CV 79%

OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data

Björn Möller, Zhengyang Li, Malte Stelzer, Thomas Graave, Fabian Bettels, Muaaz Ataya, Tim Fingscheidt

机构 * Technische Universität Braunschweig(布拉unsch维格技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06082 2025-09-18 cs.CV 79%

SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment

Yanxiao Sun, Jiafu Wu, Yun Cao, Chengming Xu, Yabiao Wang, Weijian Cao, Donghao Luo, Chengjie Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏