arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2402.13126 2025-07-08 cs.CR cs.AI cs.CV cs.LG eess.IV 62%

VGMShield: Mitigating Misuse of Video Generative Models

Yan Pang, Baicheng Chen, Yang Zhang, Tianhao Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12601 2025-07-03 cs.CV cs.GR cs.MM 62%

DreamCinema: Cinematic Transfer with Free Camera and 3D Character

Weiliang Chen, Fangfu Liu, Diankun Wu, Haowen Sun, Jiwen Lu, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Project page: https://liuff19.github.io/DreamCinema

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15461 2025-06-11 cs.CV cs.MM cs.RO 62%

EVA: An Embodied World Model for Future Video Anticipation

Xiaowei Chi, Chun-Kai Fan, Hengyuan Zhang, Xingqun Qi, Rongyu Zhang, Anthony Chen, Chi-min Chan, Wei Xue, Qifeng Liu, Shanghang Zhang, Yike Guo

机构 * Hong Kong University of Science(香港科学与技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00868 2025-05-14 cs.CV eess.IV 62%

RT-GAN: Recurrent Temporal GAN for Adding Lightweight Temporal Consistency to Frame-Based Domain Translation Approaches

Shawn Mathew, Saad Nadeem, Alvin C. Goh, Arie Kaufman

机构 * Stony Brook University(石溪布鲁克大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025 Early Accept. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12831 2025-03-28 cs.CV cs.AI cs.MM 62%

VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing

Jing Gu, Yuwei Fang, Ivan Skorokhodov, Peter Wonka, Xinya Du, Sergey Tulyakov, Xin Eric Wang

专题命中 视频生成 :long video(abstract);分类 cs.CV、cs.MM

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13501 2025-03-19 cs.CV cs.AI cs.LG cs.MM 62%

VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis

Yumeng Li, William Beluch, Margret Keuper, Dan Zhang, Anna Khoreva

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted at ICLR 2025. Code: https://github.com/boschresearch/VSTAR and project page: https://yumengli007.github.io/VSTAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10696 2025-03-17 cs.CV eess.IV 62%

Neighboring Autoregressive Modeling for Efficient Visual Generation

Yefei He, Yuanyu He, Shaoxuan He, Feng Chen, Hong Zhou, Kaipeng Zhang, Bohan Zhuang

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14468 2024-11-05 cs.CV cs.AI cs.MM 62%

AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks

Max Ku, Cong Wei, Weiming Ren, Harry Yang, Wenhu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Published in Transactions on Machine Learning Research (TMLR 2024) (11/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21061 2024-10-29 cs.CV cs.AI cs.MM 62%

Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework

Vladimir Arkhipkin, Viacheslav Vasilev, Andrei Filatov, Igor Pavlov, Julia Agafonova, Nikolai Gerasimenko, Anna Averchenkova, Evelina Mironova, Anton Bukashkin, Konstantin Kulikov, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted for EMNLP 2024 (Demo track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08534 2024-10-22 cs.CV eess.IV 62%

Quality Prediction of AI Generated Images and Videos: Emerging Trends and Opportunities

Abhijay Ghildyal, Yuanhan Chen, Saman Zadtootaghaj, Nabajeet Barman, Alan C. Bovik

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03340 2024-08-08 cs.MM cs.CV 62%

An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval

Mahesh Kandhare, Thibault Gisselbrecht

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 24 figures (65 images)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03511 2024-07-01 cs.CV cs.LG cs.MM 62%

Kandinsky 3.0 Technical Report

Vladimir Arkhipkin, Andrei Filatov, Viacheslav Vasilev, Anastasia Maltseva, Said Azizov, Igor Pavlov, Julia Agafonova, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Project page: https://ai-forever.github.io/Kandinsky-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16728 2024-05-28 cs.CV cs.AI cs.LG cs.MM 62%

Towards Multi-Task Multi-Modal Models: A Video Generative Perspective

Lijun Yu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15944 2024-03-26 cs.CV cs.AI eess.IV 62%

Adaptive Super Resolution For One-Shot Talking-Head Generation

Luchuan Song, Pinxin Liu, Guojun Yin, Chenliang Xu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07952 2024-03-14 cs.CV cs.AI cs.MM 62%

AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production

Jiuniu Wang, Zehua Du, Yuyuan Zhao, Bo Yuan, Kexiang Wang, Jian Liang, Yaxi Zhao, Yihen Lu, Gengliang Li, Junlong Gao, Xin Tu, Zhenyu Guo

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00028 2024-02-02 cs.GR cs.CV eess.IV 62%

Neural Rendering and Its Hardware Acceleration: A Review

Xinkai Yan, Jieting Xu, Yuchi Huo, Hujun Bao

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04429 2022-10-11 eess.IV cs.CV 62%

DeepHS-HDRVideo: Deep High Speed High Dynamic Range Video Reconstruction

Zeeshan Khan, Parth Shettiwar, Mukul Khanna, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments ICPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08795 2022-09-20 cs.MM cs.CV cs.SD eess.AS 62%

AutoLV: Automatic Lecture Video Generator

Wenbin Wang, Yang Song, Sanjay Jha

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 4 pages, 4 figures, ICIP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06180 2022-04-14 cs.CV cs.GR cs.MM 62%

Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions

Zipeng Ye, Zhiyao Sun, Yu-Hui Wen, Yanan Sun, Tian Lv, Ran Yi, Yong-Jin Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01866 2021-11-04 eess.IV cs.CV cs.LG physics.med-ph 62%

3-D PET Image Generation with tumour masks using TGAN

Robert V Bergen, Jean-Francois Rajotte, Fereshteh Yousefirizi, Ivan S Klyuzhin, Arman Rahmim, Raymond T. Ng

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.03120 2021-07-08 cs.CV cs.MM 62%

Cross-View Exocentric to Egocentric Video Synthesis

Gaowen Liu, Hao Tang, Hugo Latapie, Jason Corso, Yan Yan

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16078 2020-12-03 cs.CV eess.IV 62%

LIFI: Towards Linguistically Informed Frame Interpolation

Aradhya Neeraj Mathur, Devansh Batra, Yaman Kumar, Rajiv Ratn Shah, Roger Zimmermann

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 9 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.05018 2020-11-25 eess.IV cs.CV 62%

Source Camera Verification from Strongly Stabilized Videos

Enes Altinisik, Husrev Taha Sencar

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10704 2020-06-20 cs.CV cs.LG eess.IV 62%

Latent Video Transformer

Ruslan Rakhimov, Denis Volkhonskiy, Alexey Artemov, Denis Zorin, Evgeny Burnaev

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 61%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15564 2025-09-23 cs.CV 61%

Show-o2: Improved Native Unified Multimodal Models

Jinheng Xie, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV;video understanding(comments)

Comments NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15138 2025-03-21 cs.CV 61%

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng Chen, Harry Yang, Ser-Nam Lim

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

Comments This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-19 cs.CV 版本更新 57%

Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page Code: https://github.com/yunpeng1998/Qwen-Video-Edit Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-18 cs.CV 版本更新 57%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19505 2026-08-18 cs.CV 版本更新 57%

DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT

DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型

Xiaotao Hu, Mingkai Jia, Xiaoyang Guo, Qian Zhang, Xiao-xiao Long, Wei Yin

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。

Journal ref ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏