arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1369 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2312.02310 2023-12-06 cs.CV cs.AI cs.CL cs.LG 79%

VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding

Yizhou Wang, Ruiyi Zhang, Haoliang Wang, Uttaran Bhattacharya, Yun Fu, Gang Wu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15075 2023-11-28 cs.CV 79%

Mug-STAN: Adapting Image-Language Pretrained Models for General Video Understanding

Ruyang Liu, Jingjia Huang, Wei Gao, Thomas H. Li, Ge Li

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04914 2023-11-28 cs.CV cs.AI cs.CL 79%

Analyzing Zero-Shot Abilities of Vision-Language Models on Video Understanding Tasks

Avinash Madasu, Anahita Bhiwandiwalla, Vasudev Lal

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19773 2023-10-31 cs.CV 79%

MM-VID: Advancing Video Understanding with GPT-4V(ision)

Kevin Lin, Faisal Ahmed, Linjie Li, Chung-Ching Lin, Ehsan Azarnasab, Zhengyuan Yang, Jianfeng Wang, Lin Liang, Zicheng Liu, Yumao Lu, Ce Liu, Lijuan Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Project page at https://multimodal-vid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02858 2023-10-26 cs.CL cs.CV cs.SD eess.AS 79%

Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Hang Zhang, Xin Li, Lidong Bing

专题命中 视频理解 :video understanding(title);video-language(abstract);分类 cs.CV

Comments Accepted by EMNLP 2023's demo track; Code, Pretrained Model, and Dataset: https://github.com/DAMO-NLP-SG/Video-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15324 2023-10-25 cs.CV 79%

Videoprompter: an ensemble of foundational models for zero-shot video understanding

Adeel Yousaf, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan, Mubarak Shah

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05787 2023-08-14 cs.CV 79%

Temporally-Adaptive Models for Efficient Video Understanding

Ziyuan Huang, Shiwei Zhang, Liang Pan, Zhiwu Qing, Yingya Zhang, Ziwei Liu, Marcelo H. Ang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2110.06178

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14407 2023-05-02 cs.CV 79%

ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System

Junke Wang, Dongdong Chen, Chong Luo, Xiyang Dai, Lu Yuan, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15742 2023-04-11 cs.CV 79%

System-status-aware Adaptive Network for Online Streaming Video Understanding

Lin Geng Foo, Jia Gong, Zhipeng Fan, Jun Liu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10624 2023-04-04 cs.CV 79%

A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset

Jiaxin Deng, Dong Shen, Haojie Pan, Xiangyu Wu, Ximan Liu, Gaofeng Meng, Fan Yang, Size Li, Ruiji Fu, Zhongyuan Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by ICMR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14526 2023-03-28 cs.CV 79%

Selective Structured State-Spaces for Long-Form Video Understanding

Jue Wang, Wentao Zhu, Pichao Wang, Xiang Yu, Linda Liu, Mohamed Omar, Raffay Hamid

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.02217 2023-01-06 cs.CV 79%

EgoDistill: Egocentric Head Motion Distillation for Efficient Video Understanding

Shuhan Tan, Tushar Nagarajan, Kristen Grauman

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Tech report. Project page: https://vision.cs.utexas.edu/projects/egodistill

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.00281 2022-12-21 cs.CV 79%

Point Primitive Transformer for Long-Term 4D Point Cloud Video Understanding

Hao Wen, Yunze Liu, Jingwei Huang, Bo Duan, Li Yi

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Journal ref ECCV2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15286 2022-11-29 cs.CV 79%

Masked Autoencoders for Egocentric Video Understanding @ Ego4D Challenge 2022

Jiachen Lei, Shuang Ma, Zhongjie Ba, Sai Vemprala, Ashish Kapoor, Kui Ren

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07526 2022-10-21 cs.CV 79%

OmniVL:One Foundation Model for Image-Language and Video-Language Tasks

Junke Wang, Dongdong Chen, Zuxuan Wu, Chong Luo, Luowei Zhou, Yucheng Zhao, Yujia Xie, Ce Liu, Yu-Gang Jiang, Lu Yuan

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

Comments To appear at NeurIPs 2022, Camera Ready with Typos fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10747 2022-10-14 cs.CV cs.AI 79%

Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners

Zhenhailong Wang, Manling Li, Ruochen Xu, Luowei Zhou, Jie Lei, Xudong Lin, Shuohang Wang, Ziyi Yang, Chenguang Zhu, Derek Hoiem, Shih-Fu Chang, Mohit Bansal, Heng Ji

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02995 2022-10-07 cs.CV 79%

Compressed Vision for Efficient Video Understanding

Olivia Wiles, Joao Carreira, Iain Barr, Andrew Zisserman, Mateusz Malinowski

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

Comments ACCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09292 2022-09-27 cs.CV 79%

Free Lunch for Surgical Video Understanding by Distilling Self-Supervisions

Xinpeng Ding, Ziwei Liu, Xiaomeng Li

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments accepted at MICCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10077 2022-08-23 cs.CV cs.AI 79%

Identifying Auxiliary or Adversarial Tasks Using Necessary Condition Analysis for Adversarial Multi-task Video Understanding

Stephen Su, Samuel Kwong, Qingyu Zhao, De-An Huang, Juan Carlos Niebles, Ehsan Adeli

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.04478 2022-07-18 cs.CV cs.CL 79%

Prompting Visual-Language Models for Efficient Video Understanding

Chen Ju, Tengda Han, Kunhao Zheng, Ya Zhang, Weidi Xie

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments ECCV 2022. Project page: https://ju-chen.github.io/efficient-prompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.06178 2022-03-18 cs.CV 79%

TAda! Temporally-Adaptive Convolutions for Video Understanding

Ziyuan Huang, Shiwei Zhang, Liang Pan, Zhiwu Qing, Mingqian Tang, Ziwei Liu, Marcelo H. Ang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to ICLR 2022. Project page: https://tadaconv-iclr2022.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01215 2021-12-01 cs.CV 79%

Gradient Frequency Modulation for Visually Explaining Video Understanding Models

Xinmiao Lin, Wentao Bao, Matthew Wright, Yu Kong

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by BMVC 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.09887 2021-11-19 cs.CV cs.LG 79%

PyTorchVideo: A Deep Learning Library for Video Understanding

Haoqi Fan, Tullie Murrell, Heng Wang, Kalyan Vasudev Alwala, Yanghao Li, Yilei Li, Bo Xiong, Nikhila Ravi, Meng Li, Haichuan Yang, Jitendra Malik, Ross Girshick, Matt Feiszli, Aaron Adcock, Wan-Yen Lo, Christoph Feichtenhofer

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01673 2021-11-03 cs.CV 79%

Relational Self-Attention: What's Missing in Attention for Video Understanding

Manjin Kim, Heeseung Kwon, Chunyu Wang, Suha Kwak, Minsu Cho

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.04203 2021-10-19 cs.AI cs.CV cs.HC 79%

Toward a Human-Level Video Understanding Intelligence

Yu-Jung Heo, Minsu Lee, Seongho Choi, Woo Suk Choi, Minjung Shin, Minjoon Jung, Jeh-Kwang Ryu, Byoung-Tak Zhang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Presented at AI-HRI symposium as part of AAAI-FSS 2021 (arXiv:2109.10836). The first two authors have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.13227 2021-09-28 cs.CV cs.AR cs.LG 79%

TSM: Temporal Shift Module for Efficient and Scalable Video Understanding on Edge Device

Ji Lin, Chuang Gan, Kuan Wang, Song Han

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Journal preprint of arXiv:1811.08383 (TPAMI, 2020). arXiv admin note: substantial text overlap with arXiv:1910.00932

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.10132 2021-08-17 cs.CV cs.CL 79%

VLG-Net: Video-Language Graph Matching Network for Video Grounding

Mattia Soldan, Mengmeng Xu, Sisi Qu, Jesper Tegner, Bernard Ghanem

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

Comments 14 pages, 7 figures, In proceeding of the ICCV21 workshop: AI for Creative Video Editing and Understanding 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11310 2021-06-22 cs.CV 79%

Towards Long-Form Video Understanding

Chao-Yuan Wu, Philipp Krähenbühl

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments CVPR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.07135 2021-04-16 cs.CV 79%

Adaptive Intermediate Representations for Video Understanding

Juhana Kangaspunta, AJ Piergiovanni, Rico Jonschkowski, Michael Ryoo, Anelia Angelova

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00990 2021-04-05 cs.CV cs.CL 79%

Visual Semantic Role Labeling for Video Understanding

Arka Sadhu, Tanmay Gupta, Mark Yatskar, Ram Nevatia, Aniruddha Kembhavi

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments CVPR21 camera-ready including appendix. Project Page at https://vidsitu.org/

详情

展开后加载摘要…

URL PDF HTML 收藏