arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6737 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2410.11623 2024-10-16 cs.CV cs.AI cs.CL 79%

VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI

Sijie Cheng, Kechen Fang, Yangyang Yu, Sicheng Zhou, Bohao Li, Ye Tian, Tingguang Li, Lei Han, Yang Liu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16341 2024-09-10 cs.CV 79%

Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding

Yuanhao Xiong, Long Zhao, Boqing Gong, Ming-Hsuan Yang, Florian Schroff, Ting Liu, Cho-Jui Hsieh, Liangzhe Yuan

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

Comments Accepted to ICLR2024, see https://openreview.net/forum?id=5dlfiJIXoh for more details

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03206 2024-09-06 cs.CV cs.AI 79%

TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations

Mingze Gao, Jingyu Liu, Mingda Li, Jiangtao Xie, Qingbin Liu, Bo Zhao, Xi Chen, Hui Xiong

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16500 2024-08-30 cs.CV 79%

CogVLM2: Visual Language Models for Image and Video Understanding

Wenyi Hong, Weihan Wang, Ming Ding, Wenmeng Yu, Qingsong Lv, Yan Wang, Yean Cheng, Shiyu Huang, Junhui Ji, Zhao Xue, Lei Zhao, Zhuoyi Yang, Xiaotao Gu, Xiaohan Zhang, Guanyu Feng, Da Yin, Zihan Wang, Ji Qi, Xixuan Song, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Yuxiao Dong, Jie Tang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11897 2024-08-20 cs.CV 79%

Text-Conditioned Resampler For Long Form Video Understanding

Bruno Korbar, Yongqin Xian, Alessio Tonioni, Andrew Zisserman, Federico Tombari

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

Comments Accepted to the ECCV24 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03567 2024-08-08 cs.CV cs.CL 79%

Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning

Zi-Yi Dou, Xitong Yang, Tushar Nagarajan, Huiyu Wang, Jing Huang, Nanyun Peng, Kris Kitani, Fu-Jen Chu

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14872 2024-07-23 cs.CV cs.RO 79%

Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts

Yanting Yang, Minghao Chen, Qibo Qiu, Jiahao Wu, Wenxiao Wang, Binbin Lin, Ziyu Guan, Xiaofei He

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

Comments ECCV 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14146 2024-07-22 cs.MM 79%

Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition

Rui Zhang, Yafen Lu, Pengli Ji, Junxiao Xue, Xiaoran Yan

专题命中 视频理解 :video-language(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13627 2024-07-16 cs.CV cs.AI 79%

Vamos: Versatile Action Models for Video Understanding

Shijie Wang, Qi Zhao, Minh Quan Do, Nakul Agarwal, Kwonjoon Lee, Chen Sun

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to ECCV 2024 (European Conference on Computer Vision). Code and models are released at https://brown-palm.github.io/Vamos/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17309 2024-06-26 cs.CV 79%

Zero-Shot Long-Form Video Understanding through Screenplay

Yongliang Wu, Bozheng Li, Jiawang Cao, Wenbo Zhu, Yi Lu, Weiheng Chi, Chuyun Xie, Haolin Zheng, Ziyue Su, Jay Wu, Xu Yang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Highest Score Award to the CVPR'2024 LOVEU Track 1 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17005 2024-06-26 cs.CV 79%

PVUW 2024 Challenge on Complex Video Understanding: Methods and Results

Henghui Ding, Chang Liu, Yunchao Wei, Nikhila Ravi, Shuting He, Song Bai, Philip Torr, Deshui Miao, Xin Li, Zhenyu He, Yaowei Wang, Ming-Hsuan Yang, Zhensong Xu, Jiangtao Yao, Chengjing Wu, Ting Liu, Luoqi Liu, Xinyu Liu, Jing Zhang, Kexin Zhang, Yuting Yang, Licheng Jiao, Shuyuan Yang, Mingqi Gao, Jingnan Luo, Jinyu Yang, Jungong Han, Feng Zheng, Bin Cao, Yisi Zhang, Xuanxu Lin, Xingjian He, Bo Zhao, Jing Liu, Feiyu Pan, Hao Fang, Xiankai Lu

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments MOSE Challenge: https://henghuiding.github.io/MOSE/ChallengeCVPR2024, MeViS Challenge: https://henghuiding.github.io/MeViS/ChallengeCVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13807 2024-06-24 cs.CV cs.AI cs.CL 79%

AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding

Alessandro Suglia, Claudio Greco, Katie Baker, Jose L. Part, Ioannis Papaioannou, Arash Eshghi, Ioannis Konstas, Oliver Lemon

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Code available https://github.com/alanaai/EVUD

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09418 2024-06-14 cs.CV 79%

VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Khan

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05861 2024-06-03 cs.CV 79%

Memory Consolidation Enables Long-Context Video Understanding

Ivana Balažević, Yuge Shi, Pinelopi Papalampidi, Rahma Chaabouni, Skanda Koppula, Olivier J. Hénaff

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08344 2024-05-15 cs.CV 79%

No Time to Waste: Squeeze Time into Channel for Mobile Video Understanding

Yingjie Zhai, Wenshuo Li, Yehui Tang, Xinghao Chen, Yunhe Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03770 2024-05-08 cs.CV 79%

Foundation Models for Video Understanding: A Survey

Neelu Madan, Andreas Moegelmose, Rajat Modi, Yogesh S. Rawat, Thomas B. Moeslund

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05726 2024-04-25 cs.CV 79%

MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding

Bo He, Hengduo Li, Young Kyun Jang, Menglin Jia, Xuefei Cao, Ashish Shah, Abhinav Shrivastava, Ser-Nam Lim

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2024. Project Page https://boheumd.github.io/MA-LMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08046 2024-04-08 cs.CV 79%

Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

Peng Jin, Ryuichi Takanobu, Wancai Zhang, Xiaochun Cao, Li Yuan

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03413 2024-04-05 cs.CV 79%

MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens

Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman, Deyao Zhu, Jian Ding, Mohamed Elhoseiny

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 6 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20031 2024-04-01 cs.CV 79%

A Unified Framework for Human-centric Point Cloud Video Understanding

Yiteng Xu, Kecheng Ye, Xiao Han, Yiming Ren, Xinge Zhu, Yuexin Ma

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17935 2024-03-28 cs.CV 79%

OmniVid: A Generative Framework for Universal Video Understanding

Junke Wang, Dongdong Chen, Chong Luo, Bo He, Lu Yuan, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10517 2024-03-18 cs.CV cs.AI cs.CL cs.IR 79%

VideoAgent: Long-form Video Understanding with Large Language Model as Agent

Xiaohan Wang, Yuhui Zhang, Orr Zohar, Serena Yeung-Levy

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03037 2024-03-06 cs.CV cs.LG 79%

A Backpack Full of Skills: Egocentric Video Understanding with Diverse Task Perspectives

Simone Alberto Peirone, Francesca Pistilli, Antonio Alliegro, Giuseppe Averta

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024. Project webpage at https://sapeirone.github.io/EgoPack

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08731 2024-02-02 cs.CV 79%

EPIC Fields: Marrying 3D Geometry and Video Understanding

Vadim Tschernezki, Ahmad Darkhalil, Zhifan Zhu, David Fouhey, Iro Laina, Diane Larlus, Dima Damen, Andrea Vedaldi

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Published at NeurIPS 2023. 24 pages, 15 figures. Project Webpage: http://epic-kitchens.github.io/epic-fields

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16280 2024-01-30 cs.CV 79%

Cutup and Detect: Human Fall Detection on Cutup Untrimmed Videos Using a Large Foundational Video Understanding Model

Till Grutschus, Ola Karrar, Emir Esenov, Ekta Vats

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09057 2024-01-30 cs.CV 79%

CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding

Yunze Liu, Changxi Chen, Zifan Wang, Li Yi

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Journal ref ICRA2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06355 2024-01-05 cs.CV cs.CL 79%

VideoChat: Chat-Centric Video Understanding

KunChang Li, Yinan He, Yi Wang, Yizhuo Li, Wenhai Wang, Ping Luo, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10639 2023-12-19 cs.CV cs.AI physics.optics 79%

Artificial intelligence optical hardware empowers high-resolution hyperspectral video understanding at 1.2 Tb/s

Maksim Makarenko, Qizhou Wang, Arturo Burguete-Lopez, Silvio Giancola, Bernard Ghanem, Luca Passone, Andrea Fratalocchi

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06720 2023-12-15 cs.CV 79%

Audio-Visual LLM for Video Understanding

Fangxun Shu, Lei Zhang, Hao Jiang, Cihang Xie

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13435 2023-12-14 cs.CV cs.AI 79%

PG-Video-LLaVA: Pixel Grounding Large Video-Language Models

Shehan Munasinghe, Rusiru Thushara, Muhammad Maaz, Hanoona Abdul Rasheed, Salman Khan, Mubarak Shah, Fahad Khan

专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏