arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6732 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1368 篇

2510.06077 2025-10-08 cs.CV cs.AI 83%

When Thinking Drifts: Evidential Grounding for Robust Video Reasoning

Mi Luo, Zihui Xue, Alex Dimakis, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC Berkeley(伯克利大学) Bespoke Labs(Bespoke实验室)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025, Project page: https://vision.cs.utexas.edu/projects/video-ver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05836 2025-10-08 cs.CV 83%

Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow

Ruyang Liu, Shangkun Sun, Haoran Tang, Ge Li, Wei Gao

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, 2 Peng Cheng LaboratoryPeking University(1 电子与计算机工程学院,深圳研究生院,2 深圳鹏城实验室,北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments Accepted to ICCV' 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03501 2025-10-08 cs.CV 83%

LV-MAE: Learning Long Video Representations through Masked-Embedding Autoencoders

Ilan Naiman, Emanuel Ben-Baruch, Oron Anschel, Alon Shoshan, Igor Kviatkovsky, Manoj Aggarwal, Gerard Medioni

机构 * Amazon(亚马逊)

专题命中 视频理解 :long video(title,abstract);video-language(abstract);分类 cs.CV

Comments Accepted to the International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04909 2025-10-01 cs.CV cs.AI 83%

HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding

Yuxuan Cai, Jiangning Zhang, Zhenye Gan, Qingdong He, Xiaobin Hu, Junwei Zhu, Yabiao Wang, Chengjie Wang, Zhucun Xue, Chaoyou Fu, Xinwei He, Xiang Bai

机构 * Fantasyele

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12083 2025-09-30 cs.CV 83%

Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization

Pritam Sarkar, Ali Etemad

机构 * Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09079 2025-09-29 cs.CV cs.AI 83%

VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks

Xinlong Chen, Yuanxing Zhang, Yushuo Guan, Weihong Lin, Zekun Wang, Bohan Zeng, Yang Shi, Sihan Yang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19650 2025-09-01 cs.CV 83%

Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models

Hou Xia, Zheren Fu, Fangcan Ling, Jiajun Li, Yi Tu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) HUAWEI(华为)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08989 2025-08-13 cs.CV 83%

KFFocus: Highlighting Keyframes for Enhanced Video Understanding

Ming Nie, Chunwei Wang, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02591 2025-07-24 cs.CV 83%

AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding

Weili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) HKUST (GZ)(香港科技大学(广州)) Zhejiang University / Shanghai AI Lab(浙江大学/上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09876 2025-07-15 cs.CV cs.AI cs.CL 83%

ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models

Yongheng Zhang, Xu Liu, Ruihan Tao, Qiguang Chen, Hao Fei, Wanxiang Che, Libo Qin

机构 * School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) Research Center for SCIR, Harbin Institute of Technology(SCIR研究中心,哈尔滨工业大学) NExT Research Center, National University of Singapore(NExT研究中心,新加坡国立大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19225 2025-06-25 cs.CV cs.AI 83%

Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification

Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Shanghai Jiao Tong University(上海交通大学) University of Trento(特伦特大学) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments 12 pages, 5 Figure, 3 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14356 2025-06-18 cs.CV cs.AI 83%

EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization

Xiaoqi Wang, Yi Wang, Lap-Pui Chau

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09402 2025-06-10 cs.CV 83%

VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary

Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. Github: https://github.com/showlab/VLog

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03990 2025-06-05 cs.CL cs.CV 83%

DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding

Hongzhi Zhang, Jingyuan Zhang, Xingguang Ji, Qi Wang, Fuzheng Zhang

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01300 2025-06-03 cs.CV 83%

ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding

Yiyang Zhou, Yangfan He, Yaofeng Su, Siwei Han, Joel Jang, Gedas Bertasius, Mohit Bansal, Huaxiu Yao

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

Comments 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15269 2025-05-22 cs.CV 83%

LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval

Zhenyu Ning, Guangda Liu, Qihao Jin, Wenchao Ding, Minyi Guo, Jieru Zhao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Guizhou Provincial Laboratory of Big Data, College of Computer Science and Technology, Guizhou University(贵州大数据省实验室,贵州大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08455 2025-05-14 cs.CV 83%

VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models

Pritam Sarkar, Ali Etemad

机构 * Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03173 2025-05-07 cs.CV cs.AI 83%

RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph

Sameer Malik, Moyuru Yamada, Ayush Singh, Dishank Aggarwal

机构 * Fujitsu Research of India Private Limited(日本富士通印度研究私有限公司)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08585 2025-04-25 cs.CV 83%

HierarQ: Task-Aware Hierarchical Q-Former for Enhanced Video Understanding

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments Accepted in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14553 2025-04-22 cs.CV 83%

Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection

Weijun Zhuang, Qizhang Li, Xin Li, Ming Liu, Xiaopeng Hong, Feng Gao, Fan Yang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01798 2025-04-18 cs.CV 83%

SEAL: Semantic Attention Learning for Long Video Representation

Lan Wang, Yujia Chen, Du Tran, Vishnu Naresh Boddeti, Wen-Sheng Chu

专题命中 视频理解 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09641 2025-04-15 cs.CV 83%

TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

Xingjian Zhang, Siwei Wen, Wenjun Wu, Lei Huang

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04471 2025-04-08 cs.CV 83%

VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT

Zhuo Zhi, Qiangqiang Wu, Minghe shen, Wenbo Li, Yinchuan Li, Kun Shao, Kaiwen Zhou

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21483 2025-03-28 cs.CV 83%

BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding

Shuming Liu, Chen Zhao, Tianqi Xu, Bernard Ghanem

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05510 2025-03-28 cs.CV cs.AI 83%

OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?

Yifei Li, Junbo Niu, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, Pan Zhang, Yuhang Zang, Yuhang Cao, Conghui He, Jiaqi Wang

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05037 2025-03-28 cs.CV cs.LG 83%

LongViTU: Instruction Tuning for Long-Form Video Understanding

Rujie Wu, Xiaojian Ma, Hai Ci, Yue Fan, Yuxuan Wang, Haozhe Zhao, Qing Li, Yizhou Wang

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12355 2025-03-26 cs.CV 83%

DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding

Yudong Han, Qingpei Guo, Liyuan Pan, Liu Liu, Yu Guan, Ming Yang

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments Accepted by CVPR 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11392 2025-03-17 cs.CV 83%

Watch and Learn: Leveraging Expert Knowledge and Language for Surgical Video Understanding

David Gastager, Ghazal Ghazaei, Constantin Patsch

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

Comments 14 pages main manuscript with 3 figures; 6 pages supplementary material with 3 figures. To be presented at International Conference on Information Processing in Computer-Assisted Interventions (IPCAI 2025). To be published in International Journal of Computer Assisted Radiology and Surgery (IJCARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19209 2025-03-17 cs.CV cs.AI cs.CL 83%

VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos

Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, Mohit Bansal

专题命中 视频理解 :long video(title,abstract);video understanding(abstract);分类 cs.CV

Comments CVPR 2025; First three authors contributed equally; Project page: https://videotree2024.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19520 2025-02-28 cs.CV cs.LG 83%

Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation

Tz-Ying Wu, Kyle Min, Subarna Tripathi, Nuno Vasconcelos

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏