arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2401.06129 2024-04-17 cs.CV 70%

Distilling Vision-Language Models on Millions of Videos

Yue Zhao, Long Zhao, Xingyi Zhou, Jialin Wu, Chun-Te Chu, Hui Miao, Florian Schroff, Hartwig Adam, Ting Liu, Boqing Gong, Philipp Krähenbühl, Liangzhe Yuan

专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08850 2024-02-20 cs.CV 70%

Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts

Yuyang Zhao, Enze Xie, Lanqing Hong, Zhenguo Li, Gim Hee Lee

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://make-a-protagonist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03716 2023-11-08 cs.CL cs.AI cs.CV 70%

LLM as an Art Director (LaDi): Using LLMs to improve Text-to-Media Generators

Allen Roush, Emil Zakirov, Artemiy Shirokov, Polina Lunina, Jack Gane, Alexander Duffy, Charlie Basil, Aber Whitcomb, Jim Benedetto, Chris DeWolfe

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages, System Demonstration/Industry paper. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09662 2023-05-17 cs.CV cs.AI 70%

Make-An-Animation: Large-Scale Text-conditional 3D Human Motion Generation

Samaneh Azadi, Akbar Shah, Thomas Hayes, Devi Parikh, Sonal Gupta

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2304.07410

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.03206 2022-06-08 eess.AS cs.AI eess.IV 70%

FlexLip: A Controllable Text-to-Lip System

Dan Oneata, Beata Lorincz, Adriana Stan, Horia Cucu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 eess.IV

Comments 16 pages, 4 tables, 4 figures

Journal ref Sensors. 2022; 22(11):4104

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12417 2021-11-25 cs.CV cs.AI 70%

NÜWA: Visual Synthesis Pre-training for Neural visUal World creAtion

Chenfei Wu, Jian Liang, Lei Ji, Fan Yang, Yuejian Fang, Daxin Jiang, Nan Duan

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.02681 2021-10-20 cs.CL cs.AI cs.CV cs.LG 70%

VidLanKD: Improving Language Understanding via Video-Distilled Knowledge Transfer

Zineng Tang, Jaemin Cho, Hao Tan, Mohit Bansal

专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV

Comments NeurIPS 2021 (19 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09240 2021-07-21 cs.LG cs.CL cs.CV 70%

Generative Video Transformer: Can Objects be the Words?

Yi-Fu Wu, Jaesik Yoon, Sungjin Ahn

专题命中 视频生成 :video generation(abstract);video reasoning(abstract);分类 cs.CV

Comments Published in ICML 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.07995 2021-05-10 cs.CV 70%

Write-a-speaker: Text-based Emotional and Rhythmic Talking-head Generation

Lincheng Li, Suzhen Wang, Zhimeng Zhang, Yu Ding, Yixing Zheng, Xin Yu, Changjie Fan

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26628 2026-05-27 cs.AI 67%

Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

Zhanfeng Feng, Shuai Guo, Xin Di, Long Peng, Yang Cao, Zhengjun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

AI总结 提出Tail-Aware HiFloat4方法,通过感知激活尾部的百分位校准和紧凑PTQ状态恢复,在HiFloat4数值格式下对Wan2.2进行W4A4训练后量化,减少罕见校准异常值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03374 2026-05-12 cs.HC 67%

How do people watch AI-generated videos of physical scenes?

人们如何观看物理场景的AI生成视频?

Danqing Shi, Lan Jiang, Katherine M. Collins, Shangzhe Wu, Ayush Tewari, Miri Zilka

专题命中 视频生成 :video generation(abstract);video understanding(abstract)

AI总结 研究探讨了人们观看物理场景AI生成视频时的注视行为,发现高真实感视频的观看方式受观众感知真实性影响,而非视频实际真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20731 2025-03-27 cs.LG 67%

RecTable: Fast Modeling Tabular Data with Rectified Flow

Masane Fuchi, Tomohiro Takagi

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

Comments 19 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09333 2024-08-29 cs.CL 67%

SkyScript-100M: 1,000,000,000 Pairs of Scripts and Shooting Scripts for Short Drama

Jing Tang, Quanlu Jia, Yuqiang Xie, Zeyu Gong, Xiang Wen, Jiayi Zhang, Yalong Guo, Guibin Chen, Jiangping Yang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12377 2024-04-19 cs.RO 67%

RoboDreamer: Learning Compositional World Models for Robot Imagination

Siyuan Zhou, Yilun Du, Jiaben Chen, Yandong Li, Dit-Yan Yeung, Chuang Gan

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01322 2024-04-03 cs.CL cs.AI 67%

A Review of Multi-Modal Large Language and Vision Models

Kilian Carolan, Laura Fennelly, Alan F. Smeaton

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

Comments 33 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06606 2019-12-16 cs.CV cs.LG cs.MM eess.IV 67%

Music-oriented Dance Video Synthesis with Pose Perceptual Loss

Xuanchi Ren, Haoran Li, Zijian Huang, Qifeng Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 62%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交 62%

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19474 2026-07-08 cs.CV cs.AI cs.MM 62%

Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks

Pistachio: 向合成、平衡和长形式视频异常基准迈进

Jie Li, Hongyi Cai, Mingkang Dong, Muxin Pu, Shan You, Fei Wang, Tao Huang

机构 * Universiti Malaya(马来亚大学) Monash University(莫纳什大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Pistachio基准,通过生成式流程构建,提供可控场景、异常类型和时间叙事,减少人工标注依赖,验证了现有方法的挑战并推动动态多事件异常理解研究。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18993 2026-04-22 cs.CV cs.AI cs.MM 62%

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

AutoAWG:用于自动驾驶视频的自适应多控逆境天气生成

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun

机构 * MiLM Plus, Xiaomi Inc.(小米 MiLM Plus) Xiaomi Inc.(小米公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出AutoAWG,通过自适应多控生成逆境天气视频,提升自动驾驶感知鲁棒性,实验表明其在FID和FVD指标上显著优于现有方法。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06593 2026-02-26 cs.CV eess.IV 62%

Capturing Stable HDR Videos Using a Dual-Camera System

利用双摄像头系统捕捉稳定HDR视频

Qianyu Zhang, Bolun Zheng, Lingyu Zhu, Hangjia Pan, Zunjie Zhu, Zongpeng Li, Shiqi Wang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Hangzhou Dianzi University(杭州电子科技大学) Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了一种双摄像头系统和曝光自适应融合网络,用于解决HDR视频中时间闪烁问题,提升视频重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21365 2026-02-26 cs.CV cs.AI cs.LG eess.IV 62%

Towards Controllable Video Synthesis of Routine and Rare OR Events

面向常规和罕见OR事件可控视频合成

Dominik Schneider, Lalithkumar Seenivasan, Sampath Rapuri, Vishalroshan Anil, Aiza Maksutova, Yiqing Shen, Jan Emily Mangulabnan, Hao Ding, Jose L. Porras, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University Munich(慕尼黑技术大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。

Comments Accepted to IPCAI 2026 and submitted to IJCARs

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17650 2025-12-22 cs.CV cs.MM 62%

Region-Constraint In-Context Generation for Instructional Video Editing

区域约束的上下文生成用于教学视频编辑

Zhongwei Zhang, Fuchen Long, Wei Li, Zhaofan Qiu, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。

Comments Project page: https://zhw-zhang.github.io/ReCo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17735 2025-12-02 cs.MM cs.CV 62%

RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation

RDTF:面向多帧动画贴纸生成的资源高效双掩码训练框架

Zhiqiang Yuan, Ting Zhang, Peixiang Luo, Ying Deng, Jiapei Zhang, Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能图案识别中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 RDTF通过三种核心设计,为多帧动画贴纸生成任务提供资源高效的解决方案,优于现有PEFT方法。

Comments Submitted to TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07633 2025-11-12 cs.CV cs.MM 62%

T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates

Zhitao Wang, Hengyu Man, Wenrui Li, Xingtao Wang, Xiaopeng Fan, Debin Zhao

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.12510 2025-10-10 cs.CV cs.MM 62%

PRVR: Partially Relevant Video Retrieval

Xianke Chen, Daizong Liu, Xun Yang, Xirong Li, Jianfeng Dong, Meng Wang, Xun Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) School of Statistics and Mathematics(统计学与数学学院) Zhejiang Gongshang University(浙江工商大学) Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(大数据与未来电子商务技术重点实验室) Wangxuan Institute of Computer Technology(王萱计算机技术研究所) School of Information Science and Technology(信息科学与技术学院) University of Science and Technology of China(中国科学技术大学) School of Information(信息学院) Renmin University of China(中国人民大学) School of Computer Science and Information Engineering(计算机科学与信息工程学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted by TPAMI. The paper's homepage is https://github.com/HuiGuanLab/ms-sl-pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05661 2025-10-08 cs.CV cs.MM 62%

When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach

Daniel Gonzálbez-Biosca, Josep Cabacas-Maso, Carles Ventura, Ismael Benito-Altamirano

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunications, Universitat Oberta de Catalunya(eHealth中心,计算机科学、多媒体与电信学院,开放大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00050 2025-10-02 cs.MM cs.AI cs.CV cs.SD eess.AS 62%

Object-AVEdit: An Object-level Audio-Visual Editing Model

Youquan Fu, Ruiyang Si, Hongfa Wang, Dongzhan Zhou, Jiacheng Sun, Ping Luo, Di Hu, Hongyuan Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院) China Telecom(中国电信) Gaoling School of Artificial Intelligence(东城区人工智能学院) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tencent Data Platform(腾讯数据平台) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏