arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2212.11972 2023-06-16 cs.LG cs.CV cs.NE 57%

Scalable Adaptive Computation for Iterative Generation

Allan Jabri, David Fleet, Ting Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICML'23. Code at https://github.com/google-research/pix2seq

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01363 2023-06-05 cs.CV 57%

Quantifying Sample Anonymity in Score-Based Generative Models with Adversarial Fingerprinting

Mischa Dombrowski, Bernhard Kainz

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01469 2023-06-01 cs.LG cs.CV stat.ML 57%

Consistency Models

Yang Song, Prafulla Dhariwal, Mark Chen, Ilya Sutskever

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01133 2023-05-31 cs.CV 57%

SceneScape: Text-Driven Consistent Scene Generation

Rafail Fridman, Amit Abecasis, Yoni Kasten, Tali Dekel

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://scenescape.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05199 2023-04-06 cs.CV 57%

MAGVIT: Masked Generative Video Transformer

Lijun Yu, Yong Cheng, Kihyuk Sohn, José Lezama, Han Zhang, Huiwen Chang, Alexander G. Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, Lu Jiang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments CVPR 2023 highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05051 2023-04-06 cs.CV 57%

VindLU: A Recipe for Effective Video-and-Language Pretraining

Feng Cheng, Xizi Wang, Jie Lei, David Crandall, Mohit Bansal, Gedas Bertasius

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments CVPR 2023. Project page: https://klauscc.github.io/vindlu.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04761 2023-03-09 cs.CV 57%

Video-P2P: Video Editing with Cross-attention Control

Shaoteng Liu, Yuechen Zhang, Wenbo Li, Zhe Lin, Jiaya Jia

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 10 pages, 9 figures. Project page: https://video-p2p.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07848 2023-02-16 cs.CV 57%

One-Shot Face Video Re-enactment using Hybrid Latent Spaces of StyleGAN2

Trevine Oorloff, Yaser Yacoob

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments The project page is located at https://trevineoorloff.github.io/FaceVideoReenactment_HybridLatents.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11280 2023-01-27 cs.CV cs.AI cs.LG 57%

Text-To-4D Dynamic Scene Generation

Uriel Singer, Shelly Sheynin, Adam Polyak, Oron Ashual, Iurii Makarov, Filippos Kokkinos, Naman Goyal, Andrea Vedaldi, Devi Parikh, Justin Johnson, Yaniv Taigman

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13340 2022-12-29 cs.CV 57%

Recovering Surveillance Video Using RF Cues

Xiang Li, Rabih Younes

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14758 2022-11-29 cs.CV 57%

VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild

Kun Cheng, Xiaodong Cun, Yong Zhang, Menghan Xia, Fei Yin, Mingrui Zhu, Xuan Wang, Jue Wang, Nannan Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH Asia 2022 Conference Proceedings. Project page: https://vinthony.github.io/video-retalking/

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.11898 2022-11-28 cs.CV 57%

Pose-Guided High-Resolution Appearance Transfer via Progressive Training

Ji Liu, Heshan Liu, Mang-Tik Chiu, Yu-Wing Tai, Chi-Keung Tang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 10 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11351 2022-11-22 cs.CV 57%

Are All Combinations Equal? Combining Textual and Visual Features with Multiple Space Learning for Text-Based Video Retrieval

Damianos Galanopoulos, Vasileios Mezaris

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Accepted for publication; to be included in Proc. ECCV Workshops 2022. The version posted here is the "submitted manuscript" version

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13559 2022-10-14 cs.CV 57%

ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning

Junting Pan, Ziyi Lin, Xiatian Zhu, Jing Shao, Hongsheng Li

专题命中 视频生成 :video understanding(abstract);分类 cs.CV

Comments Accepted in NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02872 2022-10-07 cs.CV 57%

Text-driven Video Prediction

Xue Song, Jingjing Chen, Bin Zhu, Yu-Gang Jiang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07278 2022-10-06 cs.CV 57%

Learning Long-Term Style-Preserving Blind Video Temporal Consistency

Hugo Thimonier, Julien Despois, Robin Kips, Matthieu Perrot

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Journal ref 2021 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.09814 2022-08-15 cs.CV 57%

NUWA-Infinity: Autoregressive over Autoregressive Generation for Infinite Visual Synthesis

Chenfei Wu, Jian Liang, Xiaowei Hu, Zhe Gan, Jianfeng Wang, Lijuan Wang, Zicheng Liu, Yuejian Fang, Nan Duan

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 24 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05739 2022-07-19 cs.CV cs.AI cs.CL cs.HC cs.MA 57%

Learning to Retrieve Videos by Asking Questions

Avinash Madasu, Junier Oliva, Gedas Bertasius

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Journal ref ACM Multimedia 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07441 2022-05-23 cs.CV cs.CL cs.IR 57%

COTS: Collaborative Two-Stream Vision-Language Pre-Training Model for Cross-Modal Retrieval

Haoyu Lu, Nanyi Fei, Yuqi Huo, Yizhao Gao, Zhiwu Lu, Ji-Rong Wen

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.09494 2022-05-10 cs.CV cs.LG 57%

Transframer: Arbitrary Frame Prediction with Generative Models

Charlie Nash, João Carreira, Jacob Walker, Iain Barr, Andrew Jaegle, Mateusz Malinowski, Peter Battaglia

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01122 2022-03-22 cs.CV 57%

M3L: Language-based Video Editing via Multi-Modal Multi-Level Transformers

Tsu-Jui Fu, Xin Eric Wang, Scott T. Grafton, Miguel P. Eckstein, William Yang Wang

专题命中 视频生成 :video understanding(abstract);分类 cs.CV

Comments CVPR'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.04036 2022-03-18 cs.CV 57%

StyleHEAT: One-Shot High-Resolution Editable Talking Face Generation via Pre-trained StyleGAN

Fei Yin, Yong Zhang, Xiaodong Cun, Mingdeng Cao, Yanbo Fan, Xuan Wang, Qingyan Bai, Baoyuan Wu, Jue Wang, Yujiu Yang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page is at http://feiiyin.github.io/StyleHEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07086 2022-03-15 cs.CV 57%

MDMMT-2: Multidomain Multimodal Transformer for Video Retrieval, One More Step Towards Generalization

Alexander Kunitsyn, Maksim Kalashnikov, Maksim Dzabraev, Andrei Ivaniuta

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08591 2021-12-07 cs.CV 57%

Diverse Generation from a Single Video Made Possible

Niv Haim, Ben Feinstein, Niv Granot, Assaf Shocher, Shai Bagon, Tali Dekel, Michal Irani

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.09855 2021-12-02 cs.CV cs.GR 57%

Infinite Nature: Perpetual View Generation of Natural Scenes from a Single Image

Andrew Liu, Richard Tucker, Varun Jampani, Ameesh Makadia, Noah Snavely, Angjoo Kanazawa

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2021 (oral); Project page: https://infinite-nature.github.io/; Video: https://www.youtube.com/watch?v=oXUf6anNAtc

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10916 2021-11-23 cs.CV cs.LG 57%

Video Content Swapping Using GAN

Tingfung Lau, Sailun Xu, Xinze Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.14147 2021-10-29 cs.CV 57%

Image Comes Dancing with Collaborative Parsing-Flow Video Synthesis

Bowen Wu, Zhenyu Xie, Xiaodan Liang, Yubei Xiao, Haoye Dong, Liang Lin

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments TIP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.08580 2021-10-19 cs.CV 57%

Intelligent Video Editing: Incorporating Modern Talking Face Generation Algorithms in a Video Editor

Anchit Gupta, Faizan Farooq Khan, Rudrabha Mukhopadhyay, Vinay P. Namboodiri, C. V. Jawahar

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 9 pages, 7 figures, accepted in ICVGIP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.12671 2021-10-18 cs.CV 57%

Multimodal Clustering Networks for Self-supervised Learning from Unlabeled Videos

Brian Chen, Andrew Rouditchenko, Kevin Duarte, Hilde Kuehne, Samuel Thomas, Angie Boggust, Rameswar Panda, Brian Kingsbury, Rogerio Feris, David Harwath, James Glass, Michael Picheny, Shih-Fu Chang

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments To be presented at ICCV 2021

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2021, pp. 8012-8021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01442 2021-10-05 cs.LG cs.AI cs.CV 57%

A review of Generative Adversarial Networks (GANs) and its applications in a wide variety of disciplines -- From Medical to Remote Sensing

Ankan Dash, Junyi Ye, Guiling Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 41 pages, 10 figures, ACM Computing Surveys (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏