arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2008.09646 2025-07-08 eess.IV cs.CV cs.LG 81%

HRVGAN: High Resolution Video Generation using Spatio-Temporal GAN

Abhinav Sagar

机构 * University of Maryland(马里兰大学) College Park, Maryland

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19680 2025-06-30 cs.CV cs.AI cs.MM 81%

MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng, Yuefeng Zhu, Fangyuan Zou

机构 * Tencent(腾讯) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18866 2025-06-24 cs.CV cs.AI cs.MM 81%

OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Qijun Gan, Ruizi Yang, Jianke Zhu, Shaofei Xue, Steven Hoi

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Project page: https://omni-avatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03150 2025-06-04 cs.CV cs.AI cs.LG cs.MM 81%

IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang

机构 * University of Oxford(牛津大学) UC Merced(加州大学默塞德分校) NEC Labs America(NEC美国实验室) Atmanity Inc.(Atmanity公司) Google DeepMind Project(谷歌DeepMind项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24253 2025-06-02 cs.CV cs.AI cs.MM 81%

Interactive Video Generation via Domain Adaptation

Ishaan Rawal, Suryansh Kumar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18597 2025-03-27 cs.CV cs.AI cs.MM 81%

DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation

Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02610 2025-02-06 cs.AI cs.CV cs.HC cs.MM 81%

Secure & Personalized Music-to-Video Generation via CHARCHA

Mehul Agarwal, Gauri Agarwal, Santiago Benoit, Andrew Lippman, Jean Oh

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2024 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03143 2024-10-15 eess.IV cs.CV cs.LG 81%

ECHOPulse: ECG controlled echocardio-grams video generation

Yiwei Li, Sekeun Kim, Zihao Wu, Hanqi Jiang, Yi Pan, Pengfei Jin, Sifan Song, Yucheng Shi, Tianming Liu, Quanzheng Li, Xiang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16283 2024-09-25 cs.RO cs.CV cs.LG eess.IV 81%

Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation

Homanga Bharadhwaj, Debidatta Dwibedi, Abhinav Gupta, Shubham Tulsiani, Carl Doersch, Ted Xiao, Dhruv Shah, Fei Xia, Dorsa Sadigh, Sean Kirmani

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15217 2024-08-28 eess.IV cs.AI cs.CV 81%

Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance

Weiyi Zhang, Siyu Huang, Jiancheng Yang, Ruoyu Chen, Zongyuan Ge, Yingfeng Zheng, Danli Shi, Mingguang He

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments The paper has been accepted by Medical Image Computing and Computer Assisted Intervention Society (MICCAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21490 2024-08-01 eess.IV cs.AI cs.CV cs.LG 81%

Explainable and Controllable Motion Curve Guided Cardiac Ultrasound Video Generation

Junxuan Yu, Rusi Chen, Yongsong Zhou, Yanlin Chen, Yaofei Duan, Yuhao Huang, Han Zhou, Tan Tao, Xin Yang, Dong Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by MICCAI MLMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03641 2024-07-17 cs.CV cs.AI cs.LG cs.MM 81%

MotionCtrl: A Unified and Flexible Motion Controller for Video Generation

Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments SIGGRAPH 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08944 2024-07-17 cs.CV eess.IV 81%

Bora: Biomedical Generalist Video Generation Model

Weixiang Sun, Xiaocao You, Ruizhe Zheng, Zhengqing Yuan, Xiang Li, Lifang He, Quanzheng Li, Lichao Sun

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14381 2024-04-23 cs.CV cs.MM 81%

TAVGBench: Benchmarking Text to Audible-Video Generation

Yuxin Mao, Xuyang Shen, Jing Zhang, Zhen Qin, Jinxing Zhou, Mochu Xiang, Yiran Zhong, Yuchao Dai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Technical Report. Project page:https://github.com/OpenNLPLab/TAVGBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03040 2024-02-06 cs.CV cs.AI cs.LG cs.MM 81%

InteractiveVideo: User-Centric Controllable Video Generation with Synergistic Multimodal Instructions

Yiyuan Zhang, Yuhao Kang, Zhixin Zhang, Xiaohan Ding, Sanyuan Zhao, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Code, models, and demo are available at https://github.com/invictus717/InteractiveVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06329 2023-11-14 cs.CV cs.AI cs.CL cs.LG eess.IV 81%

A Survey of AI Text-to-Image and AI Text-to-Video Generators

Aditi Singh

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、eess.IV

Comments 4 pages, 2 tables, 4th International Conference on Artificial Intelligence, Robotics and Control (AIRC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03884 2023-11-08 eess.IV cs.CV 81%

MeVGAN: GAN-based Plugin Model for Video Generation with Applications in Colonoscopy

Łukasz Struski, Tomasz Urbańczyk, Krzysztof Bucki, Bartłomiej Cupiał, Aneta Kaczyńska, Przemysław Spurek, Jacek Tabor

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08009 2023-09-18 cs.CV cs.MM 81%

Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset

Iya Chivileva, Philip Lynch, Tomas E. Ward, Alan F. Smeaton

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16541 2023-06-16 cs.CV cs.AI cs.MM 81%

Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation

Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, Jing Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01832 2022-07-28 cs.MM cs.CV 81%

Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval

Fan Hu, Aozhu Chen, Ziyue Wang, Fangming Zhou, Jianfeng Dong, Xirong Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05986 2022-04-20 cs.CV cs.MM 81%

Audio-Driven Talking Face Video Generation with Dynamic Convolution Kernels

Zipeng Ye, Mengfei Xia, Ran Yi, Juyong Zhang, Yu-Kun Lai, Xuwei Huang, Guoxin Zhang, Yong-jin Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 81%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10233 2021-11-22 cs.CV cs.LG eess.IV 81%

Xp-GAN: Unsupervised Multi-object Controllable Video Generation

Bahman Rouhani, Mohammad Rahmati

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11894 2021-10-26 cs.CV cs.MM 81%

Towards Using Clothes Style Transfer for Scenario-aware Person Video Generation

Jingning Xu, Benlai Tang, Mingjie Wang, Siyuan Bian, Wenyi Guo, Xiang Yin, Zejun Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04806 2021-07-15 cs.SD cs.CV eess.AS eess.IV 81%

Speech2Video: Cross-Modal Distillation for Speech to Video Generation

Shijing Si, Jianzong Wang, Xiaoyang Qu, Ning Cheng, Wenqi Wei, Xinghua Zhu, Jing Xiao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by InterSpeech2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14678 2021-06-01 cs.CV eess.IV 81%

Image-to-Video Generation via 3D Facial Dynamics

Xiaoguang Tu, Yingtian Zou, Jian Zhao, Wenjie Ai, Jian Dong, Yuan Yao, Zhikang Wang, Guodong Guo, Zhifeng Li, Wei Liu, Jiashi Feng

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09737 2021-02-22 cs.CV cs.SD eess.AS eess.IV 81%

One Shot Audio to Animated Video Generation

Neeraj Kumar, Srishti Goel, Ankur Narang, Brejesh Lall, Mujtaba Hasan, Pranshu Agarwal, Dipankar Sarkar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments arXiv admin note: substantial text overlap with arXiv:2012.07842, arXiv:2012.07304

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01823 2020-11-12 cs.CV cs.LG eess.IV 81%

Temporal Shift GAN for Large Scale Video Generation

Andres Munoz, Mohammadreza Zolfaghari, Max Argus, Thomas Brox

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08048 2026-06-23 cs.CV 版本更新 80%

S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix

S^2VG:基于去噪帧矩阵的3D立体与空间视频生成

Peng Dai, Feitong Tan, Qiangeng Xu, Yihua Huang, David Futschik, Ruofei Du, Sean Fanello, Yinda Zhang, Xiaojuan Qi

机构 * Department of Electrical and Electronic Engineering at The University of Hong Kong(香港大学电子与电气工程系) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种无需姿态和训练的方法,利用现成单目视频生成模型,通过深度图扭曲和帧矩阵修复框架,生成时空一致的3D立体与空间视频。

Comments immersive video generation, 4D scene, spatial video, stereo video

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06571 2023-08-15 cs.CV cs.AI 80%

ModelScope Text-to-Video Technical Report

Jiuniu Wang, Hangjie Yuan, Dayou Chen, Yingya Zhang, Xiang Wang, Shiwei Zhang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Technical report. Project page: \url{https://modelscope.cn/models/damo/text-to-video-synthesis/summary}

详情

展开后加载摘要…

URL PDF HTML 收藏