arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1369 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2509.00357 2025-09-03 cs.CV cs.AI cs.LG 79%

SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding

Zhen Chen, Xingjian Luo, Kun Yuan, Jinlin Wu, Danny T. M. Chan, Nassir Navab, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * Hong Kong Institute of Science & Innovation(香港科学与工业创新研究院) CAMP, Technische Universität München(CAMP,慕尼黑技术大学) Department of Surgery, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院外科部)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17844 2025-08-26 cs.CV cs.AI 79%

SV3.3B: A Sports Video Understanding Model for Action Recognition

Sai Varun Kodathala, Yashwanth Reddy Vutukoori, Rakesh Vunnam

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 8 pages, 6 figures, 4 tables. Submitted to AIxSET 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01422 2025-08-12 cs.CV 79%

DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes

Zhende Song, Chenchen Wang, Jiamu Sheng, Chi Zhang, Shengji Tang, Jiayuan Fan, Tao Chen

机构 * Fudan University(复旦大学) Westlake University, Tencent PCG(西湖大学、腾讯PCG)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by ACMM'MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18342 2025-07-25 cs.CV 79%

EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs

Yuping He, Yifei Huang, Guo Chen, Baoqi Pei, Jilan Xu, Tong Lu, Jiangmiao Pang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Tokyo(东京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15569 2025-07-22 cs.CV 79%

DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding

Xiaoyi Bao, Chenwei Xie, Hao Tang, Tingyu Weng, Xiaofeng Wang, Yun Zheng, Xingang Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团) Peking University(北京大学) Luoyang Institute for Robot and Intelligent Equipment(洛阳机器人与智能装备研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06072 2025-07-09 cs.CV 79%

MCAM: Multimodal Causal Analysis Model for Ego-Vehicle-Level Driving Video Understanding

Tongtong Cheng, Rongzhen Li, Yixin Xiong, Tao Zhang, Jing Wang, Kai Liu

机构 * Department of Computer Science, Chongqing University, China(重庆大学计算机科学系) National Elite Institute of Engineering, Chongqing University, China(重庆大学工程精英研究院) College of Computer Science and Technology, National University of Deffense Technology, China(国防科技大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Journal ref ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21116 2025-07-09 cs.CV cs.AI 79%

IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes

Yujia Liang, Jile Jiao, Xuetao Feng, Zixuan Ye, Yuan Wang, Zhicheng Wang

机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院) Deepeleph Intelligent Technology(DeepEleph智能技术) JD Explore Academy(JD探索学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04289 2025-07-08 cs.CV cs.AI 79%

M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li, Shoujun Zhou, Hongliang Li, Fuxia Yang

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Chinese Academy of Sciences(中国科学院) Air Force Hospital of Southern Theater Command of PLA(中国人民解放军南部战区空军医院) Shenzhen Traditional Chinese Medicine Hospital(深圳中医药医院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 19 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13860 2025-07-08 cs.CV cs.AI 79%

Domain Adaptation of VLM for Soccer Video Understanding

Tiancheng Jiang, Henry Wang, Md Sirajus Salekin, Parmida Atighehchian, Shinan Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 8 pages, 5 figures, accepted to the 11th IEEE International Workshop on Computer Vision in Sports (CVSports) at CVPR 2025; supplementary appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16427 2025-07-08 cs.CV 79%

Fine-Grained Captioning of Long Videos through Scene Graph Consolidation

Sanghyeok Chu, Seonguk Seo, Bohyung Han

机构 * ECE, Seoul National University, Korea.(电子工程系,首尔国立大学,韩国) IPAI, Seoul National University, Korea.(人工智能研究所,首尔国立大学,韩国)

专题命中 视频理解 :long video(title,abstract);分类 cs.CV

Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13956 2025-06-19 cs.CV 79%

Improving LLM Video Understanding with 16 Frames Per Second

Yixuan Li, Changli Tang, Jimin Zhuang, Yudong Yang, Guangzhi Sun, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01426 2025-06-17 cs.CV cs.CL cs.LG 79%

Unifying Specialized Visual Encoders for Video Language Models

Jihoon Chung, Tyler Zhu, Max Gonzalez Saez-Diez, Juan Carlos Niebles, Honglu Zhou, Olga Russakovsky

机构 * Department of Computer Science, Princeton University, Princeton, NJ, United States(普林斯顿大学计算机科学系) Salesforce Research, Palo Alto, CA, United States(Salesforce研究)

专题命中 视频理解 :video language model(title);video understanding(abstract);分类 cs.CV

Comments Accepted to ICML 2025 as a Poster. Project page: https://tylerzhu.com/merv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15513 2025-06-11 cs.CV 79%

TinyLLaVA-Video: Towards Smaller LMMs for Video Understanding with Group Resampler

Xingjian Zhang, Xi Weng, Yihao Yue, Zhaoxin Fan, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与通信工程学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments code and training recipes are available at https://github.com/ZhangXJ199/TinyLLaVA-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07971 2025-06-10 cs.CV 79%

CyberV: Cybernetics for Test-time Scaling in Video Understanding

Jiahao Meng, Shuyang Sun, Yue Tan, Lu Qi, Yunhai Tong, Xiangtai Li, Longyin Wen

机构 * Peking University(北京大学) ByteDance(字节跳动)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07600 2025-06-10 cs.CV cs.AI 79%

SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding

Nianbo Zeng, Haowen Hou, Fei Richard Yu, Si Shi, Ying Tiffany He

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) College of Computer Science and Software Engineering(计算机科学与软件工程学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13217 2025-06-10 cs.CV cs.AI 79%

VideoPrism: A Foundational Visual Encoder for Video Understanding

Long Zhao, Nitesh B. Gundavarapu, Liangzhe Yuan, Hao Zhou, Shen Yan, Jennifer J. Sun, Luke Friedman, Rui Qian, Tobias Weyand, Yue Zhao, Rachel Hornung, Florian Schroff, Ming-Hsuan Yang, David A. Ross, Huisheng Wang, Hartwig Adam, Mikhail Sirotenko, Ting Liu, Boqing Gong

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted to ICML 2024. v2: added retrieval results on MSRVTT (1K-A), more data analyses, and ablation studies; v3: released models at https://github.com/google-deepmind/videoprism

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08989 2025-06-06 cs.CV cs.AI 79%

LoViT: Long Video Transformer for Surgical Phase Recognition

Yang Liu, Maxence Boels, Luis C. Garcia-Peraza-Herrera, Tom Vercauteren, Prokar Dasgupta, Alejandro Granados, Sebastien Ourselin

机构 * Department of Surgical & Interventional Engineering, King’s College London(外科与介入工程系,伦敦国王学院) Department of Peter Gorer(彼得·戈尔德系) Department of Immunobiology, King’s College London(免疫生物学系,伦敦国王学院)

专题命中 视频理解 :long video(title,abstract);分类 cs.CV

Comments Code link: https://github.com/MRUIL/LoViT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03179 2025-06-05 cs.CV cs.AI 79%

Vid-SME: Membership Inference Attacks against Large Video Understanding Models

Qi Li, Runpeng Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02975 2025-06-04 cs.CV cs.AI 79%

HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation

Yicheng Xiao, Lin Song, Rui Yang, Cheng Cheng, Zunnan Xu, Zhaoyang Zhang, Yixiao Ge, Xiu Li, Ying Shan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The University of Hong Kong(香港大学) Xi’an JiaoTong University(西安交通大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13106 2025-06-04 cs.CV 79%

VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Boqiang Zhang, Kehan Li, Zesen Cheng, Zhiqiang Hu, Yuqian Yuan, Guanzheng Chen, Sicong Leng, Yuming Jiang, Hang Zhang, Xin Li, Peng Jin, Wenqi Zhang, Fan Wang, Lidong Bing, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎派实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments BZ, KL, ZC, ZH, YY, GC, SL, YJ, HZ, and XL contributed equally to this project. Code: https://github.com/DAMO-NLP-SG/VideoLLaMA3

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01119 2025-06-03 cs.CV 79%

MOOSE: Pay Attention to Temporal Dynamics for Video Understanding via Optical Flows

Hong Nguyen, Dung Tran, Hieu Hoang, Phong Nguyen, Shrikanth Narayanan

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) University of Southern California(南加州大学) Hanoi University of Science and Technology(河内科学技术大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22566 2025-05-29 cs.CV cs.AI 79%

Universal Visuo-Tactile Video Understanding for Embodied Interaction

Yifan Xie, Mingyang Li, Shoujie Li, Xingting Li, Guangyu Chen, Fei Ma, Fei Richard Yu, Wenbo Ding

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(SZ))

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12605 2025-05-20 cs.CV 79%

Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding

Thong Nguyen, Zhiyuan Hu, Xu Lin, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00681 2025-05-02 cs.LG cs.CV 79%

MINERVA: Evaluating Complex Video Reasoning

Arsha Nagrani, Sachit Menon, Ahmet Iscen, Shyamal Buch, Ramin Mehran, Nilpa Jha, Anja Hauth, Yukun Zhu, Carl Vondrick, Mikhail Sirotenko, Cordelia Schmid, Tobias Weyand

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 视频理解 :video reasoning(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17213 2025-04-29 cs.CV cs.AI 79%

MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding

Shiwen Cao, Zhaoxing Zhang, Junming Jiao, Juyi Qiao, Guowen Song, Rong Shen, Xiangbing Meng

机构 * Li Auto Inc.(利亚汽车公司) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15270 2025-04-22 cs.CV cs.CL 79%

An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes

Ji Qi, Yuan Yao, Yushi Bai, Bin Xu, Juanzi Li, Zhiyuan Liu, Tat-Seng Chua

机构 * Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14432 2025-04-22 cs.CV cs.AI 79%

ResNetVLLM -- Multi-modal Vision LLM for the Video Understanding Task

Ahmad Khalil, Mahmoud Khalil, Alioune Ngom

机构 * University of Windsor(温莎大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00584 2025-04-18 cs.CV cs.LG 79%

Online Video Understanding: OVBench and VideoChat-Online

Zhenpeng Huang, Xinhao Li, Jiaqi Li, Jing Wang, Xiangyu Zeng, Cheng Liang, Tao Wu, Xi Chen, Liang Li, Limin Wang

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready Version. Project Page: https://videochat-online.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07519 2025-04-11 cs.CV 79%

VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding

Henghao Zhao, Ge-Peng Ji, Rui Yan, Huan Xiong, Zechao Li

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05491 2025-04-09 cs.CV 79%

REEF: Relevance-Aware and Efficient LLM Adapter for Video Understanding

Sakib Reza, Xiyun Song, Heather Yu, Zongfang Lin, Mohsen Moghaddam, Octavia Camps

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

Comments Accepted at CVPRW'25

详情

展开后加载摘要…

URL PDF HTML 收藏