arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 576 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 576 篇

2102.01558 2022-05-18 cs.CV 57%

Occluded Video Instance Segmentation: A Benchmark

Jiyang Qi, Yan Gao, Yao Hu, Xinggang Wang, Xiaoyu Liu, Xiang Bai, Serge Belongie, Alan Yuille, Philip H. S. Torr, Song Bai

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments IJCV 2022. Project page at https://songbai.site/ovis

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01089 2022-05-03 cs.CV cs.AI cs.LG cs.RO 57%

ComPhy: Compositional Physical Reasoning of Objects and Events from Videos

Zhenfang Chen, Kexin Yi, Yunzhu Li, Mingyu Ding, Antonio Torralba, Joshua B. Tenenbaum, Chuang Gan

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments ICLR 2022. Project page: https://comphyreasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10160 2022-04-27 cs.CV 57%

A Multi-Person Video Dataset Annotation Method of Spatio-Temporally Actions

Fan Yang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02968 2022-04-07 cs.CV 57%

Temporal Alignment Networks for Long-term Video

Tengda Han, Weidi Xie, Andrew Zisserman

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments CVPR2022 Oral, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14821 2022-04-05 cs.CV cs.CL cs.LG 57%

End-to-End Referring Video Object Segmentation with Multimodal Transformers

Adam Botach, Evgenii Zheltonozhskii, Chaim Baskin

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00431 2022-03-29 cs.CV cs.AI 57%

MAD: A Scalable Dataset for Language Grounding in Videos from Movie Audio Descriptions

Mattia Soldan, Alejandro Pardo, Juan León Alcázar, Fabian Caba Heilbron, Chen Zhao, Silvio Giancola, Bernard Ghanem

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

Comments 12 Pages, 6 Figures, 7 Tables

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.11859 2021-12-08 cs.CV 57%

STEP: Segmenting and Tracking Every Pixel

Mark Weber, Jun Xie, Maxwell Collins, Yukun Zhu, Paul Voigtlaender, Hartwig Adam, Bradley Green, Andreas Geiger, Bastian Leibe, Daniel Cremers, Aljoša Ošep, Laura Leal-Taixé, Liang-Chieh Chen

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2021 Track on Datasets and Benchmarks. Code: https://github.com/google-research/deeplab2

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07950 2021-11-16 cs.CV 57%

Occluded Video Instance Segmentation: Dataset and ICCV 2021 Challenge

Jiyang Qi, Yan Gao, Yao Hu, Xinggang Wang, Xiaoyu Liu, Xiang Bai, Serge Belongie, Alan Yuille, Philip H. S. Torr, Song Bai

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2021 Datasets and Benchmarks Track. arXiv admin note: text overlap with arXiv:2102.01558

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.03446 2021-10-08 cs.CV cs.AI cs.LG 57%

A Hierarchical Variational Neural Uncertainty Model for Stochastic Video Prediction

Moitreya Chatterjee, Narendra Ahuja, Anoop Cherian

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments Accepted at ICCV 2021 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11243 2021-09-24 cs.CV 57%

Pairwise Emotional Relationship Recognition in Drama Videos: Dataset and Benchmark

Xun Gao, Yin Zhao, Jie Zhang, Longjun Cai

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Journal ref ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01799 2021-09-07 cs.CV 57%

PR-Net: Preference Reasoning for Personalized Video Highlight Detection

Runnan Chen, Penghao Zhou, Wenzhe Wang, Nenglun Chen, Pai Peng, Xing Sun, Wenping Wang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04542 2021-08-24 cs.AI cs.CV 57%

TrUMAn: Trope Understanding in Movies and Animations

Hung-Ting Su, Po-Wei Shen, Bing-Chen Tsai, Wen-Feng Cheng, Ke-Jyun Wang, Winston H. Hsu

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments CIKM 2021. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.04632 2021-08-20 cs.CV cs.CL 57%

VALUE: A Multi-Task Benchmark for Video-and-Language Understanding Evaluation

Linjie Li, Jie Lei, Zhe Gan, Licheng Yu, Yen-Chun Chen, Rohit Pillai, Yu Cheng, Luowei Zhou, Xin Eric Wang, William Yang Wang, Tamara Lee Berg, Mohit Bansal, Jingjing Liu, Lijuan Wang, Zicheng Liu

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

Comments To appear in 35th Conference on Neural Information Processing Systems (NeurIPS 2021) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.07404 2021-08-19 cs.CV 57%

MultiSports: A Multi-Person Video Dataset of Spatio-Temporally Localized Sports Actions

Yixuan Li, Lei Chen, Runyu He, Zhenzhi Wang, Gangshan Wu, Limin Wang

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICCV 2021 camera ready version. One track of DeeperAction Workshop@ICCV2021. HomePage: https://deeperaction.github.io/multisports/

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12309 2021-08-10 cs.CV 57%

Spatial-Temporal Transformer for Dynamic Scene Graph Generation

Yuren Cong, Wentong Liao, Hanno Ackermann, Bodo Rosenhahn, Michael Ying Yang

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments accepted by ICCV 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08860 2021-05-11 cs.CV 57%

CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval

Huaishao Luo, Lei Ji, Ming Zhong, Yang Chen, Wen Lei, Nan Duan, Tianrui Li

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13367 2021-04-20 cs.CV 57%

SoccerNet-v2: A Dataset and Benchmarks for Holistic Understanding of Broadcast Soccer Videos

Adrien Deliège, Anthony Cioppa, Silvio Giancola, Meisam J. Seikavandi, Jacob V. Dueholm, Kamal Nasrollahi, Bernard Ghanem, Thomas B. Moeslund, Marc Van Droogenbroeck

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Paper accepted for the CVsports workshop at CVPR2021. This document contains 8 pages + references + supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04691 2021-04-13 cs.CV 57%

Unidentified Video Objects: A Benchmark for Dense, Open-World Segmentation

Weiyao Wang, Matt Feiszli, Heng Wang, Du Tran

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.05488 2021-02-23 cs.CV 57%

EEV: A Large-Scale Dataset for Studying Evoked Expressions from Video

Jennifer J. Sun, Ting Liu, Alan S. Cowen, Florian Schroff, Hartwig Adam, Gautam Prasad

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Data subset at https://github.com/google-research-datasets/eev

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.11071 2021-02-18 cs.CV 57%

QuerYD: A video dataset with high-quality text and audio narrations

Andreea-Maria Oncescu, João F. Henriques, Yang Liu, Andrew Zisserman, Samuel Albanie

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments 5 pages, 4 figures, accepted at ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00463 2020-09-15 cs.AI cs.CL cs.CV 57%

HLVU : A New Challenge to Test Deep Understanding of Movies the Way Humans do

Keith Curtis, George Awad, Shahzad Rajput, Ian Soboroff

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.02375 2020-07-07 cs.CV cs.CL 57%

Auto-captions on GIF: A Large-scale Video-sentence Dataset for Vision-language Pre-training

Yingwei Pan, Yehao Li, Jianjie Luo, Jun Xu, Ting Yao, Tao Mei

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments The Auto-captions on GIF dataset is available at \url{http://www.auto-video-captions.top/2020/dataset}

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.04744 2020-04-07 cs.CV 57%

CATER: A diagnostic dataset for Compositional Actions and TEmporal Reasoning

Rohit Girdhar, Deva Ramanan

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICLR 2020 (oral). Webpage/code/data: https://rohitgirdhar.github.io/CATER

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02634 2020-02-12 cs.CV cs.AI cs.LG 57%

Scaling Autoregressive Video Models

Dirk Weissenborn, Oscar Täckström, Jakob Uszkoreit

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments International Conference on Learning Representations (ICLR) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11819 2020-02-10 cs.CV 57%

Grape detection, segmentation and tracking using deep neural networks and three-dimensional association

Thiago T. Santos, Leonardo L. de Souza, Andreza A. dos Santos, Sandra Avila

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Journal ref Computers and Electronics in Agriculture, 170, 105-247 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.12295 2019-10-29 cs.CV 57%

MOD: A Deep Mixture Model with Online Knowledge Distillation for Large Scale Video Temporal Concept Localization

Rongcheng Lin, Jing Xiao, Jianping Fan

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments ICCV 2019 YouTube8M workshop

Journal ref ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.04804 2019-08-19 cs.CV 57%

Video Instance Segmentation

Linjie Yang, Yuchen Fan, Ning Xu

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

Comments Accepted to ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.05634 2019-04-17 cs.CV cs.CL 57%

Adversarial Inference for Multi-Sentence Video Description

Jae Sung Park, Marcus Rohrbach, Trevor Darrell, Anna Rohrbach

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted to Computer Vision and Pattern Recognition (CVPR) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.01358 2019-01-03 cs.CV 57%

Long-Term Visual Object Tracking Benchmark

Abhinav Moudgil, Vineet Gandhi

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments ACCV 2018 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.09044 2018-10-31 cs.CV 57%

VIENA2: A Driving Anticipation Dataset

Mohammad Sadegh Aliakbarian, Fatemeh Sadat Saleh, Mathieu Salzmann, Basura Fernando, Lars Petersson, Lars Andersson

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

Comments Accepted in ACCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏