arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1375 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

2106.03152 2021-06-16 cs.CV 57%

Technical Report: Temporal Aggregate Representations

Fadime Sener, Dibyadip Chatterjee, Angela Yao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05058 2021-06-10 cs.CV 57%

Towards Training Stronger Video Vision Transformers for EPIC-KITCHENS-100 Action Recognition

Ziyuan Huang, Zhiwu Qing, Xiang Wang, Yutong Feng, Shiwei Zhang, Jianwen Jiang, Zhurong Xia, Mingqian Tang, Nong Sang, Marcelo H. Ang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPRW 2021, EPIC-KITCHENS-100 Competition Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03772 2021-06-08 cs.CV 57%

Learning Dynamics via Graph Neural Networks for Human Pose Estimation and Tracking

Yiding Yang, Zhou Ren, Haoxiang Li, Chunluan Zhou, Xinchao Wang, Gang Hua

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00451 2021-06-02 cs.CV cs.AI cs.CL 57%

Highlight Timestamp Detection Model for Comedy Videos via Multimodal Sentiment Analysis

Fan Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.04489 2021-05-11 cs.CV cs.CL cs.LG cs.SD eess.AS 57%

Spoken Moments: Learning Joint Audio-Visual Representations from Video Descriptions

Mathew Monfort, SouYoung Jin, Alexander Liu, David Harwath, Rogerio Feris, James Glass, Aude Oliva

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To appear at CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.13400 2021-04-29 cs.CV cs.LG 57%

FrameExit: Conditional Early Exiting for Efficient Video Recognition

Amir Ghodrati, Babak Ehteshami Bejnordi, Amirhossein Habibian

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2021 | Oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10492 2021-04-22 cs.CV 57%

Skimming and Scanning for Untrimmed Video Action Recognition

Yunyan Hong, Ailing Zeng, Min Li, Cewu Lu, Li Jiang, Qiang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05970 2021-04-14 cs.CV 57%

Crossover Learning for Fast Online Video Instance Segmentation

Shusheng Yang, Yuxin Fang, Xinggang Wang, Yu Li, Chen Fang, Ying Shan, Bin Feng, Wenyu Liu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11272 2021-03-16 cs.CV 57%

A Novel Approach for Robust Multi Human Action Recognition and Summarization based on 3D Convolutional Neural Networks

Noor Almaadeed, Omar Elharrouss, Somaya Al-Maadeed, Ahmed Bouridane, Azeddine Beghdadi

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.09280 2021-01-18 cs.CV cs.LG 57%

Continuous Emotion Recognition with Spatiotemporal Convolutional Neural Networks

Thomas Teixeira, Eric Granger, Alessandro Lameiras Koerich

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.05061 2021-01-14 cs.CV cs.RO 57%

Understanding Action Sequences based on Video Captioning for Learning-from-Observation

Iori Yanokura, Naoki Wake, Kazuhiro Sasabuchi, Katsushi Ikeuchi, Masayuki Inaba

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13046 2020-11-30 cs.CV 57%

Can Temporal Information Help with Contrastive Self-Supervised Learning?

Yutong Bai, Haoqi Fan, Ishan Misra, Ganesh Venkatesh, Yongyi Lu, Yuyin Zhou, Qihang Yu, Vikas Chandra, Alan Yuille

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.09046 2020-11-25 cs.CV cs.CL 57%

A Hierarchical Multi-Modal Encoder for Moment Localization in Video Corpus

Bowen Zhang, Hexiang Hu, Joonseok Lee, Ming Zhao, Sheide Chammas, Vihan Jain, Eugene Ie, Fei Sha

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14810 2020-10-29 cs.CV cs.LG 57%

Cycle-Contrast for Self-Supervised Video Representation Learning

Quan Kong, Wenpeng Wei, Ziwei Deng, Tomoaki Yoshinaga, Tomokazu Murakami

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14338 2020-10-19 cs.CL cs.CV 57%

Beyond Instructional Videos: Probing for More Diverse Visual-Textual Grounding on YouTube

Jack Hessel, Zhenhai Zhu, Bo Pang, Radu Soricut

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 11 pages including supplementary materials

Journal ref Published in EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03019 2020-10-15 cs.CV cs.LG 57%

Global Self-Attention Networks for Image Recognition

Zhuoran Shen, Irwan Bello, Raviteja Vemulapalli, Xuhui Jia, Ching-Hui Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06430 2020-08-25 cs.CV 57%

End-to-End Learning of Visual Representations from Uncurated Instructional Videos

Antoine Miech, Jean-Baptiste Alayrac, Lucas Smaira, Ivan Laptev, Josef Sivic, Andrew Zisserman

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments CVPR'2020 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.01057 2020-08-04 cs.CV 57%

Residual Frames with Efficient Pseudo-3D CNN for Human Action Recognition

Jiawei Chen, Jenson Hsiao, Chiu Man Ho

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00936 2020-08-04 cs.CV 57%

Detection and Localization of Robotic Tools in Robot-Assisted Surgery Videos Using Deep Neural Networks for Region Proposal and Detection

Duygu Sarikaya, Jason J. Corso, Khurshid A. Guru

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref IEEE Transactions on Medical Imaging 36 (2017) 1542-1549

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.00998 2020-06-11 cs.CV 57%

A Multigrid Method for Efficiently Training Video Models

Chao-Yuan Wu, Ross Girshick, Kaiming He, Christoph Feichtenhofer, Philipp Krähenbühl

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.13209 2020-05-28 cs.CV cs.LG cs.NE 57%

AssembleNet: Searching for Multi-Stream Neural Connectivity in Video Architectures

Michael S. Ryoo, AJ Piergiovanni, Mingxing Tan, Anelia Angelova

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Journal ref ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.09260 2020-05-22 cs.CV cs.RO 57%

4D Generic Video Object Proposals

Aljosa Osep, Paul Voigtlaender, Mark Weber, Jonathon Luiten, Bastian Leibe

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICRA 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08206 2020-04-23 cs.CV 57%

Mimic The Raw Domain: Accelerating Action Recognition in the Compressed Domain

Barak Battash, Haim Barad, Hanlin Tang, Amit Bleiweiss

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2020: Joint Workshop on Efficient Deep Learning in Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.09087 2020-03-23 cs.CV 57%

Fully Automated Hand Hygiene Monitoring\\in Operating Room using 3D Convolutional Neural Network

Minjee Kim, Joonmyeong Choi, Namkug Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05614 2020-03-13 cs.CV 57%

Beyond the Camera: Neural Networks in World Coordinates

Gunnar A. Sigurdsson, Abhinav Gupta, Cordelia Schmid, Karteek Alahari

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.01442 2020-03-10 cs.CV cs.AI cs.CL cs.LG 57%

CLEVRER: CoLlision Events for Video REpresentation and Reasoning

Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, Joshua B. Tenenbaum

专题命中 视频理解 :video reasoning(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work. Accepted as Oral Spotlight as ICLR 2020. Project page: http://clevrer.csail.mit.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03152 2020-02-11 cs.CV 57%

CTM: Collaborative Temporal Modeling for Action Recognition

Qian Liu, Tao Wang, Jie Liu, Yang Guan, Qi Bu, Longfei Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.06680 2020-01-22 cs.CV 57%

Tree-Structured Policy based Progressive Reinforcement Learning for Temporally Language Grounding in Video

Jie Wu, Guanbin Li, Si Liu, Liang Lin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To appear in AAAI2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11961 2019-11-28 cs.CV 57%

AdapNet: Adaptability Decomposing Encoder-Decoder Network for Weakly Supervised Action Recognition and Localization

Xiao-Yu Zhang, Changsheng Li, Haichao Shi, Xiaobin Zhu, Peng Li, Jing Dong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.08548 2019-11-21 cs.CV 57%

Cross-Class Relevance Learning for Temporal Concept Localization

Junwei Ma, Satya Krishna Gorti, Maksims Volkovs, Ilya Stanevich, Guangwei Yu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏