arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6737 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2505.08665 2025-10-06 cs.CV 74%

SkillFormer: Unified Multi-View Video Understanding for Proficiency Estimation

Edoardo Bianchi, Antonio Liotta

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted at the 2025 18th International Conference on Machine Vision. Project page at https://edowhite.github.io/SkillFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08621 2025-09-11 cs.CV 74%

AdsQA: Towards Advertisement Video Understanding

Xinwei Long, Kai Tian, Peng Xu, Guoli Jia, Jingxuan Li, Sa Yang, Yihua Shao, Kaiyan Zhang, Che Jiang, Hao Xu, Yang Liu, Jiaheng Ma, Bowen Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) CASIA(中国科学院自动化所) Harvard University(哈佛大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12687 2025-08-26 cs.AI cs.CV 74%

EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding

Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Virginia(弗吉尼亚大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03531 2025-07-08 cs.CV cs.AI 74%

Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding

Namho Kim, Junhwa Kim

机构 * Korean Broadcasting System(KBS)(韩国广播系统) Department of Artificial Intelligence(人工智能系) Konyang University(全南大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03097 2025-06-04 cs.CV cs.AI 74%

EgoVLM: Policy Optimization for Egocentric Video Understanding

Ashwin Vinod, Shrey Pandit, Aditya Vavre, Linshen Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Our Code can be found at https://github.com/adityavavre/VidEgoVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24690 2025-06-02 cs.CV 74%

Learning reusable concepts across different egocentric video understanding tasks

Simone Alberto Peirone, Francesca Pistilli, Antonio Alliegro, Tatiana Tommasi, Giuseppe Averta

机构 * Politecnico di Torino(托里诺理工学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Extended abstract derived from arXiv:2502.02487. Presented at the Second Joint Egocentric Vision (EgoVis) Workshop (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09573 2025-04-29 cs.CV cs.CL cs.LG 74%

Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering

Mark Beliaev, Victor Yang, Madhura Raju, Jiachen Sun, Xinghai Hu

机构 * Tiktok Inc.(字节跳动公司)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18152 2025-04-28 cs.CV 74%

ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding

Yi-Xing Peng, Qize Yang, Yu-Ming Tang, Shenghao Fu, Kun-Yu Lin, Xihan Wei, Wei-Shi Zheng

机构 * Sun Yat-sen University, China(中山大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11223 2025-03-19 cs.CV 74%

Efficient Transfer Learning for Video-language Foundation Models

Haoxing Chen, Zizheng Huang, Yan Hong, Yanshuo Wang, Zhongcai Lyu, Zhuoer Xu, Jun Lan, Zhangxuan Gu

专题命中 视频理解 :video-language(title);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00162 2025-03-04 cs.CV cs.AI cs.CL cs.MA 74%

PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos

Kangda Wei, Zhengyu Zhou, Bingqing Wang, Jun Araki, Lukas Lange, Ruihong Huang, Zhe Feng

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15111 2025-01-28 cs.CV 74%

HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding

Jiaxing Zhao, Qize Yang, Yixing Peng, Detao Bai, Shimin Yao, Boyuan Sun, Xiang Chen, Shenghao Fu, Weixuan chen, Xihan Wei, Liefeng Bo

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11021 2024-12-04 cs.CV cs.AI 74%

Towards Neuro-Symbolic Video Understanding

Minkyu Choi, Harsh Goel, Mohammad Omama, Yunhao Yang, Sahil Shah, Sandeep Chinchali

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted by The European Conference on Computer Vision (ECCV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03531 2024-11-07 cs.CV cs.AI 74%

Personalized Video Summarization by Multimodal Video Understanding

Brian Chen, Xiangyuan Zhao, Yingnan Zhu

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments In Proceedings of CIKM 2024 Applied Research Track

Journal ref 33rd ACM International Conference on Information and Knowledge Management (CIKM 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17987 2024-09-27 cs.CV cs.HC 74%

LLM4Brain: Training a Large Language Model for Brain Video Understanding

Ruizhe Zheng, Lichao Sun

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ECCV2024 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13606 2024-09-23 cs.CV cs.LG 74%

Towards Child-Inclusive Clinical Video Understanding for Autism Spectrum Disorder

Aditya Kommineni, Digbalay Bose, Tiantian Feng, So Hyun Kim, Helen Tager-Flusberg, Somer Bishop, Catherine Lord, Sudarsana Kadiri, Shrikanth Narayanan

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08150 2024-09-06 cs.CV 74%

Hypergraph Multi-modal Large Language Model: Exploiting EEG and Eye-tracking Modalities to Evaluate Heterogeneous Responses for Video Understanding

Minghui Wu, Chenxu Zhao, Anyang Su, Donglin Di, Tianyu Fu, Da An, Min He, Ya Gao, Meng Ma, Kun Yan, Ping Wang

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted by ACM MULTIMEDIA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08024 2024-06-13 cs.CV cs.AI 74%

Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models

Shimin Chen, Yitian Yuan, Shaoxiang Chen, Zequn Jie, Lin Ma

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05424 2024-06-11 cs.CV 74%

Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Muhammad Maaz, Hanoona Rasheed, Salman Khan, Fahad Shahbaz Khan

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00322 2024-04-02 cs.CV 74%

Instrument-tissue Interaction Detection Framework for Surgical Video Understanding

Wenjun Lin, Yan Hu, Huazhu Fu, Mingming Yang, Chin-Boon Chng, Ryo Kawasaki, Cheekong Chui, Jiang Liu

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03050 2024-03-18 cs.CV 74%

HIG: Hierarchical Interlacement Graph Approach to Scene Graph Generation in Video Understanding

Trong-Thuan Nguyen, Pha Nguyen, Khoa Luu

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15313 2023-09-28 cs.CV 74%

M$^{3}$3D: Learning 3D priors using Multi-Modal Masked Autoencoders for 2D image and video understanding

Muhammad Abdullah Jamal, Omid Mohareri

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11244 2023-08-23 cs.CV 74%

Are current long-term video understanding datasets long-term?

Ombretta Strafforello, Klamer Schutte, Jan van Gemert

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16715 2023-08-21 cs.CV 74%

UniVTG: Towards Unified Video-Language Temporal Grounding

Kevin Qinghong Lin, Pengchuan Zhang, Joya Chen, Shraman Pramanick, Difei Gao, Alex Jinpeng Wang, Rui Yan, Mike Zheng Shou

专题命中 视频理解 :video-language(title);分类 cs.CV

Comments Accepted by ICCV 2023. 16 pages, 10 figures, 13 tables. Code: https://github.com/showlab/UniVTG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09431 2023-06-19 cs.MM 74%

Towards Long Form Audio-visual Video Understanding

Wenxuan Hou, Guangyao Li, Yapeng Tian, Di Hu

专题命中 视频理解 :video understanding(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09539 2023-05-17 cs.CV 74%

Learning Higher-order Object Interactions for Keypoint-based Video Understanding

Yi Huang, Asim Kadav, Farley Lai, Deep Patel, Hans Peter Graf

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments SRVU - ICCV' 2021 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13402 2023-04-27 cs.CV 74%

Concept Graph Neural Networks for Surgical Video Understanding

Yutong Ban, Jennifer A. Eckhoff, Thomas M. Ward, Daniel A. Hashimoto, Ozanan R. Meireles, Daniela Rus, Guy Rosman

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00325 2023-04-25 cs.CV 74%

SVT: Supertoken Video Transformer for Efficient Video Understanding

Chenbin Pan, Rui Hou, Hanchao Yu, Qifan Wang, Senem Velipasalar, Madian Khabsa

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18230 2023-04-03 cs.CV 74%

Procedure-Aware Pretraining for Instructional Video Understanding

Honglu Zhou, Roberto Martín-Martín, Mubbasir Kapadia, Silvio Savarese, Juan Carlos Niebles

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11329 2022-07-26 cs.CV 74%

Video Swin Transformers for Egocentric Video Understanding @ Ego4D Challenges 2022

Maria Escobar, Laura Daza, Cristina González, Jordi Pont-Tuset, Pablo Arbeláez

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01975 2022-07-21 cs.CV 74%

Federated Self-supervised Learning for Video Understanding

Yasar Abbas Ur Rehman, Yan Gao, Jiajun Shen, Pedro Porto Buarque de Gusmao, Nicholas Lane

专题命中 视频理解 :video understanding(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏