arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6765 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2507.17388 2025-07-24 cs.CV eess.IV 81%

EndoGen: Conditional Autoregressive Endoscopic Video Generation

Xinyu Liu, Hengyu Liu, Cheng Wang, Tianming Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) University of Georgia(佐治亚大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07449 2025-07-15 eess.IV cs.CV 81%

Ophora: A Large-Scale Data-Driven Text-Guided Ophthalmic Surgical Video Generation Model

Wei Li, Ming Hu, Guoan Wang, Lihao Liu, Kaijing Zhou, Junzhi Ning, Xin Guo, Zongyuan Ge, Lixu Gu, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Shanghai Jiao Tong University, China(上海交通大学) Monash University, Australia(墨尔本大学) East China Normal University, China(华东师范大学) Eye Hospital, Wenzhou Medical University, China(温州医学院眼医院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院) Imperial College London, UK(伦敦帝国理工学院) Shanghai Innovation Institute, China(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Early accepted in MICCAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09646 2025-07-08 eess.IV cs.CV cs.LG 81%

HRVGAN: High Resolution Video Generation using Spatio-Temporal GAN

Abhinav Sagar

机构 * University of Maryland(马里兰大学) College Park, Maryland

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19680 2025-06-30 cs.CV cs.AI cs.MM 81%

MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance

Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Junqi Cheng, Yuefeng Zhu, Fangyuan Zou

机构 * Tencent(腾讯) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18866 2025-06-24 cs.CV cs.AI cs.MM 81%

OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation

Qijun Gan, Ruizi Yang, Jianke Zhu, Shaofei Xue, Steven Hoi

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Project page: https://omni-avatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03150 2025-06-04 cs.CV cs.AI cs.LG cs.MM 81%

IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation

Yuanze Lin, Yi-Wen Chen, Yi-Hsuan Tsai, Ronald Clark, Ming-Hsuan Yang

机构 * University of Oxford(牛津大学) UC Merced(加州大学默塞德分校) NEC Labs America(NEC美国实验室) Atmanity Inc.(Atmanity公司) Google DeepMind Project(谷歌DeepMind项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24253 2025-06-02 cs.CV cs.AI cs.MM 81%

Interactive Video Generation via Domain Adaptation

Ishaan Rawal, Suryansh Kumar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18597 2025-03-27 cs.CV cs.AI cs.MM 81%

DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation

Minghong Cai, Xiaodong Cun, Xiaoyu Li, Wenze Liu, Zhaoyang Zhang, Yong Zhang, Ying Shan, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments CVPR 2025; 21 pages, 23 figures, Project page: https://onevfall.github.io/project_page/ditctrl ; GitHub repository: https://github.com/TencentARC/DiTCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02610 2025-02-06 cs.AI cs.CV cs.HC cs.MM 81%

Secure & Personalized Music-to-Video Generation via CHARCHA

Mehul Agarwal, Gauri Agarwal, Santiago Benoit, Andrew Lippman, Jean Oh

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments NeurIPS 2024 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03143 2024-10-15 eess.IV cs.CV cs.LG 81%

ECHOPulse: ECG controlled echocardio-grams video generation

Yiwei Li, Sekeun Kim, Zihao Wu, Hanqi Jiang, Yi Pan, Pengfei Jin, Sifan Song, Yucheng Shi, Tianming Liu, Quanzheng Li, Xiang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16283 2024-09-25 cs.RO cs.CV cs.LG eess.IV 81%

Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation

Homanga Bharadhwaj, Debidatta Dwibedi, Abhinav Gupta, Shubham Tulsiani, Carl Doersch, Ted Xiao, Dhruv Shah, Fei Xia, Dorsa Sadigh, Sean Kirmani

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15217 2024-08-28 eess.IV cs.AI cs.CV 81%

Fundus2Video: Cross-Modal Angiography Video Generation from Static Fundus Photography with Clinical Knowledge Guidance

Weiyi Zhang, Siyu Huang, Jiancheng Yang, Ruoyu Chen, Zongyuan Ge, Yingfeng Zheng, Danli Shi, Mingguang He

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments The paper has been accepted by Medical Image Computing and Computer Assisted Intervention Society (MICCAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21490 2024-08-01 eess.IV cs.AI cs.CV cs.LG 81%

Explainable and Controllable Motion Curve Guided Cardiac Ultrasound Video Generation

Junxuan Yu, Rusi Chen, Yongsong Zhou, Yanlin Chen, Yaofei Duan, Yuhao Huang, Han Zhou, Tan Tao, Xin Yang, Dong Ni

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by MICCAI MLMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03641 2024-07-17 cs.CV cs.AI cs.LG cs.MM 81%

MotionCtrl: A Unified and Flexible Motion Controller for Video Generation

Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, Ying Shan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments SIGGRAPH 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08944 2024-07-17 cs.CV eess.IV 81%

Bora: Biomedical Generalist Video Generation Model

Weixiang Sun, Xiaocao You, Ruizhe Zheng, Zhengqing Yuan, Xiang Li, Lifang He, Quanzheng Li, Lichao Sun

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14381 2024-04-23 cs.CV cs.MM 81%

TAVGBench: Benchmarking Text to Audible-Video Generation

Yuxin Mao, Xuyang Shen, Jing Zhang, Zhen Qin, Jinxing Zhou, Mochu Xiang, Yiran Zhong, Yuchao Dai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Technical Report. Project page:https://github.com/OpenNLPLab/TAVGBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03040 2024-02-06 cs.CV cs.AI cs.LG cs.MM 81%

InteractiveVideo: User-Centric Controllable Video Generation with Synergistic Multimodal Instructions

Yiyuan Zhang, Yuhao Kang, Zhixin Zhang, Xiaohan Ding, Sanyuan Zhao, Xiangyu Yue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments Code, models, and demo are available at https://github.com/invictus717/InteractiveVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06329 2023-11-14 cs.CV cs.AI cs.CL cs.LG eess.IV 81%

A Survey of AI Text-to-Image and AI Text-to-Video Generators

Aditi Singh

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、eess.IV

Comments 4 pages, 2 tables, 4th International Conference on Artificial Intelligence, Robotics and Control (AIRC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03884 2023-11-08 eess.IV cs.CV 81%

MeVGAN: GAN-based Plugin Model for Video Generation with Applications in Colonoscopy

Łukasz Struski, Tomasz Urbańczyk, Krzysztof Bucki, Bartłomiej Cupiał, Aneta Kaczyńska, Przemysław Spurek, Jacek Tabor

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08009 2023-09-18 cs.CV cs.MM 81%

Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset

Iya Chivileva, Philip Lynch, Tomas E. Ward, Alan F. Smeaton

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16541 2023-06-16 cs.CV cs.AI cs.MM 81%

Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation

Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, Jing Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref IEEE Transactions on Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01832 2022-07-28 cs.MM cs.CV 81%

Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval

Fan Hu, Aozhu Chen, Ziyue Wang, Fangming Zhou, Jianfeng Dong, Xirong Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05986 2022-04-20 cs.CV cs.MM 81%

Audio-Driven Talking Face Video Generation with Dynamic Convolution Kernels

Zipeng Ye, Mengfei Xia, Ran Yi, Juyong Zhang, Yu-Kun Lai, Xuwei Huang, Guoxin Zhang, Yong-jin Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Comments in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.09168 2022-03-04 cs.CV cs.AI cs.MM 81%

Reading-strategy Inspired Visual Representation Learning for Text-to-Video Retrieval

Jianfeng Dong, Yabing Wang, Xianke Chen, Xiaoye Qu, Xirong Li, Yuan He, Xun Wang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology. Code is available at https://github.com/LiJiaBei-7/rivrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10233 2021-11-22 cs.CV cs.LG eess.IV 81%

Xp-GAN: Unsupervised Multi-object Controllable Video Generation

Bahman Rouhani, Mohammad Rahmati

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11894 2021-10-26 cs.CV cs.MM 81%

Towards Using Clothes Style Transfer for Scenario-aware Person Video Generation

Jingning Xu, Benlai Tang, Mingjie Wang, Siyuan Bian, Wenyi Guo, Xiang Yin, Zejun Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04806 2021-07-15 cs.SD cs.CV eess.AS eess.IV 81%

Speech2Video: Cross-Modal Distillation for Speech to Video Generation

Shijing Si, Jianzong Wang, Xiaoyang Qu, Ning Cheng, Wenqi Wei, Xinghua Zhu, Jing Xiao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by InterSpeech2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14678 2021-06-01 cs.CV eess.IV 81%

Image-to-Video Generation via 3D Facial Dynamics

Xiaoguang Tu, Yingtian Zou, Jian Zhao, Wenjie Ai, Jian Dong, Yuan Yao, Zhikang Wang, Guodong Guo, Zhifeng Li, Wei Liu, Jiashi Feng

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09737 2021-02-22 cs.CV cs.SD eess.AS eess.IV 81%

One Shot Audio to Animated Video Generation

Neeraj Kumar, Srishti Goel, Ankur Narang, Brejesh Lall, Mujtaba Hasan, Pranshu Agarwal, Dipankar Sarkar

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments arXiv admin note: substantial text overlap with arXiv:2012.07842, arXiv:2012.07304

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.01823 2020-11-12 cs.CV cs.LG eess.IV 81%

Temporal Shift GAN for Large Scale Video Generation

Andres Munoz, Mohammadreza Zolfaghari, Max Argus, Thomas Brox

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments 14 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏