arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6759 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

2305.00355 2023-05-05 cs.CV cs.AI 57%

MH-DETR: Video Moment and Highlight Detection with Cross-modal Transformer

Yifang Xu, Yunzhuo Sun, Yang Li, Yilei Shi, Xiaoxiang Zhu, Sidan Du

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10316 2023-04-21 cs.CV 57%

Search-Map-Search: A Frame Selection Paradigm for Action Recognition

Mingjun Zhao, Yakun Yu, Xiaoli Wang, Lei Yang, Di Niu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16579 2023-04-04 cs.CV 57%

INR-V: A Continuous Representation Space for Video-based Generative Tasks

Bipasha Sen, Aditya Agarwal, Vinay P Namboodiri, C. V. Jawahar

专题命中 视频理解 :video generation(abstract);分类 cs.CV

Comments Published in Transactions on Machine Learning Research (10/2022); https://openreview.net/forum?id=aIoEkwc2oB

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17636 2023-04-03 cs.CV 57%

Whether and When does Endoscopy Domain Pretraining Make Sense?

Dominik Batić, Felix Holm, Ege Özsoy, Tobias Czempiel, Nassir Navab

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17228 2023-03-31 cs.CV 57%

Streaming Video Model

Yucheng Zhao, Chong Luo, Chuanxin Tang, Dongdong Chen, Noel Codella, Zheng-Jun Zha

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13738 2023-03-31 cs.CV cs.CL 57%

TempCLR: Temporal Alignment Representation with Contrastive Learning

Yuncong Yang, Jiawei Ma, Shiyuan Huang, Long Chen, Xudong Lin, Guangxing Han, Shih-Fu Chang

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments ICLR 2023 Camera Ready. Code Link: https://github.com/yyuncong/TempCLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16268 2023-03-30 cs.CV cs.LG 57%

TimeBalance: Temporally-Invariant and Temporally-Distinctive Video Representations for Semi-Supervised Action Recognition

Ishan Rajendrakumar Dave, Mamshad Nayeem Rizve, Chen Chen, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00182 2023-03-28 cs.CV 57%

Bidirectional Cross-Modal Knowledge Exploration for Video Recognition with Pre-trained Vision-Language Models

Wenhao Wu, Xiaohan Wang, Haipeng Luo, Jingdong Wang, Yi Yang, Wanli Ouyang

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13874 2023-03-27 cs.CV cs.AI 57%

Query-Dependent Video Representation for Moment Retrieval and Highlight Detection

WonJun Moon, Sangeek Hyun, SangUk Park, Dongchan Park, Jae-Pil Heo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2023. Code is available at https://github.com/wjun0830/QD-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09857 2023-03-20 cs.CV cs.LG 57%

Dual-path Adaptation from Image to Video Transformers

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2023. Code is available at https://github.com/park-jungin/DualPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.17042 2023-03-14 cs.CV 57%

Spatio-Temporal Crop Aggregation for Video Representation Learning

Sepehr Sameni, Simon Jenni, Paolo Favaro

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15280 2023-03-14 cs.CV cs.AI 57%

Learning Transferable Spatiotemporal Representations from Natural Script Knowledge

Ziyun Zeng, Yuying Ge, Xihui Liu, Bin Chen, Ping Luo, Shu-Tao Xia, Yixiao Ge

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2023; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12688 2023-02-27 cs.CV cs.AI cs.LG 57%

Video4MRI: An Empirical Study on Brain Magnetic Resonance Image Analytics with CNN-based Video Classification Frameworks

Yuxuan Zhang, Qingzhong Wang, Jiang Bian, Yi Liu, Yanwu Xu, Dejing Dou, Haoyi Xiong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IEEE ISBI'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03024 2023-02-07 cs.CV 57%

AIM: Adapting Image Models for Efficient Video Action Recognition

Taojiannan Yang, Yi Zhu, Yusheng Xie, Aston Zhang, Chen Chen, Mu Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ICLR 2023. Project webpage is at https://adapt-image-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08846 2023-01-24 cs.LG cs.AI cs.CL cs.CV eess.AS 57%

Regeneration Learning: A Learning Paradigm for Data Generation

Xu Tan, Tao Qin, Jiang Bian, Tie-Yan Liu, Yoshua Bengio

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03769 2023-01-11 cs.CV 57%

Learning from What is Already Out There: Few-shot Sign Language Recognition with Online Dictionaries

Matyáš Boháček, Marek Hrúz

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments 6 pages, 2 figures, IEEE Face & Gestures 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.05162 2023-01-10 cs.CV cs.CL 57%

Video2Commonsense: Generating Commonsense Descriptions to Enrich Video Captioning

Zhiyuan Fang, Tejas Gokhale, Pratyay Banerjee, Chitta Baral, Yezhou Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments EMNLP 2020. V2C Website: https://asu-apg.github.io/Video2Commonsense/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.14128 2023-01-02 cs.CV 57%

Joint Engagement Classification using Video Augmentation Techniques for Multi-person Human-robot Interaction

Yubin Kim, Huili Chen, Sharifa Alghowinem, Cynthia Breazeal, Hae Won Park

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06206 2022-12-20 cs.CV 57%

Contextual Explainable Video Representation: Human Perception-based Understanding

Khoa Vo, Kashu Yamazaki, Phong X. Nguyen, Phat Nguyen, Khoa Luu, Ngan Le

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in Asilomar Conference 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00986 2022-12-06 cs.CV cs.AI cs.CL 57%

Masked Contrastive Pre-Training for Efficient Video-Text Retrieval

Fangxun Shu, Biaolong Chen, Yue Liao, Shuwen Xiao, Wenyu Sun, Xiaobo Li, Yousong Zhu, Jinqiao Wang, Si Liu

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06346 2022-11-30 cs.CV 57%

Bringing Image Scene Structure to Video via Frame-Clip Consistency of Object Tokens

Elad Ben-Avraham, Roei Herzig, Karttikeya Mangalam, Amir Bar, Anna Rohrbach, Leonid Karlinsky, Trevor Darrell, Amir Globerson

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12748 2022-11-28 cs.CV 57%

Dynamic Appearance: A Video Representation for Action Recognition with Joint Training

Guoxi Huang, Adrian G. Bors

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11210 2022-11-24 cs.CV cs.AI cs.IR 57%

Contrastive Masked Autoencoders for Self-Supervised Video Hashing

Yuting Wang, Jinpeng Wang, Bin Chen, Ziyun Zeng, Shutao Xia

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments This work is accepted by the AAAI 2023. 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03873 2022-11-24 cs.CV cs.AI 57%

OperA: Attention-Regularized Transformers for Surgical Phase Recognition

Tobias Czempiel, Magdalini Paschali, Daniel Ostler, Seong Tae Kim, Benjamin Busam, Nassir Navab

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09552 2022-11-18 cs.CV 57%

UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer

Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 24 pages, 4 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09529 2022-11-18 cs.CV 57%

InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges

Guo Chen, Sen Xing, Zhe Chen, Yi Wang, Kunchang Li, Yizhuo Li, Yi Liu, Jiahao Wang, Yin-Dong Zheng, Bingkun Huang, Zhiyu Zhao, Junting Pan, Yifei Huang, Zun Wang, Jiashuo Yu, Yinan He, Hongjie Zhang, Tong Lu, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report in 2nd International Ego4D Workshop@ECCV 2022. Code will be released at https://github.com/OpenGVLab/ego4d-eccv2022-solutions

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.08728 2022-11-17 cs.CV 57%

Exploring State Change Capture of Heterogeneous Backbones @ Ego4D Hands and Objects Challenge 2022

Yin-Dong Zheng, Guo Chen, Jiahao Wang, Tong Lu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.03162 2022-11-08 cs.CV 57%

Transformed ROIs for Capturing Visual Transformations in Videos

Abhinav Rai, Fadime Sener, Angela Yao

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVIU 2022 - Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13326 2022-10-25 cs.CL cs.CV 57%

Clean Text and Full-Body Transformer: Microsoft's Submission to the WMT22 Shared Task on Sign Language Translation

Subhadeep Dey, Abhilash Pal, Cyrine Chaabani, Oscar Koller

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments accepted for publication at WMT2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10828 2022-10-21 cs.CV 57%

Grounded Video Situation Recognition

Zeeshan Khan, C. V. Jawahar, Makarand Tapaswi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2022. Project Page: https://zeeshank95.github.io/grvidsitu

详情

展开后加载摘要…

URL PDF HTML 收藏