arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1369 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1369 篇

2508.02134 2025-08-05 cs.CV 70%

Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference

Kuo Wang, Quanlong Zheng, Junlin Xie, Yanhao Zhang, Jinguo Luo, Haonan Lu, Liang Lin, Fan Zhou, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) OPPO AI Center(OPPO人工智能中心) Research Institute(研究 institute) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Key Laboratory of Digital Living Network and Content Service(深圳数字生活网络与内容服务重点实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments published in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19651 2025-07-30 cs.CV cs.LG cs.PF 70%

PEVLM: Parallel Encoding for Vision-Language Models

Letian Kang, Shixian Luo, Yiqiang Li, Yuxin Yin, Shenxuan Zhou, Xiaoyang Yu, Jin Yang, Yong Wu

机构 * Li Auto Inc.(利自动公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03248 2025-07-30 cs.CV cs.AI cs.CL 70%

AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning

Yiwu Zhong, Zhuoming Liu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00469 2025-07-02 cs.CV cs.LG 70%

Bisecle: Binding and Separation in Continual Learning for Video Language Understanding

Yue Tan, Xiaoqian Hu, Hao Xue, Celso De Melo, Flora D. Salim

机构 * School of Computer Science University of New South Wales(计算机科学学院新南威尔士大学) School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院新南威尔士大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 23 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17443 2025-06-27 cs.CV cs.AI cs.CL 70%

HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics

Gueter Josmy Faure, Jia-Fong Yeh, Min-Hung Chen, Hung-Ting Su, Shang-Hong Lai, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) NVIDIA(NVIDIA公司) National Tsing Hua University(国立清华大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Accepted for ICCV 2025. Project page: https://joslefaure.github.io/assets/html/hermes.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05173 2025-06-02 cs.CV 70%

VideoRoPE: What Makes for Good Video Rotary Position Embedding?

Xilin Wei, Xiaoran Liu, Yuhang Zang, Xiaoyi Dong, Pan Zhang, Yuhang Cao, Jian Tong, Haodong Duan, Qipeng Guo, Jiaqi Wang, Xipeng Qiu, Dahua Lin

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15529 2025-05-22 cs.CV 70%

Clapper: Compact Learning and Video Representation in VLMs

Lingyu Kong, Hongzhi Zhang, Jingyuan Zhang, Jianzhao Huang, Kunze Li, Qi Wang, Fuzheng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技) Xi’an Jiaotong University(西安交通大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15447 2025-05-22 cs.CV cs.AI 70%

ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning

Ziqiang Xu, Qi Dai, Tian Xie, Yifan Yang, Kai Qiu, DongDong Chen, Zuxuan Wu, Chong Luo

机构 * Fudan University(复旦大学) Microsoft(微软公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17365 2025-04-30 cs.CV cs.CL 70%

TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation

Ling You, Wenxuan Huang, Xinni Xie, Xiangyi Wei, Bangyan Li, Shaohui Lin, Yang Li, Changbo Wang

机构 * East China Normal University(东华大学)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15271 2025-04-22 cs.CV 70%

Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models

Guo Chen, Zhiqi Li, Shihao Wang, Jindong Jiang, Yicheng Liu, Lidong Lu, De-An Huang, Wonmin Byeon, Matthieu Le, Tuomas Rintamaki, Tyler Poon, Max Ehrlich, Tuomas Rintamaki, Tyler Poon, Tong Lu, Limin Wang, Bryan Catanzaro, Jan Kautz, Andrew Tao, Zhiding Yu, Guilin Liu

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13122 2025-04-18 cs.CV cs.LG 70%

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu, Meng Luo, Jinlan Fu, Xinya Du, Hanwang Zhang, Hao Fei

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Code and Data: https://github.com/HaroldChen19/VistaDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17651 2025-03-25 cs.CV 70%

Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization

Zhuo Tao, Liang Li, Qi Chen, Yunbin Tu, Zheng-Jun Zha, Ming-Hsuan Yang, Yuankai Qi, Qingming Huang

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16428 2025-03-21 cs.CL cs.CV 70%

XAttention: Block Sparse Attention with Antidiagonal Scoring

Ruyi Xu, Guangxuan Xiao, Haofeng Huang, Junxian Guo, Song Han

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14378 2025-03-19 cs.CV 70%

Impossible Videos

Zechen Bai, Hai Ci, Mike Zheng Shou

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00513 2025-03-19 cs.CV cs.IR cs.LG 70%

CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval

Yifan Xu, Xinhao Li, Yichun Yang, Desen Meng, Rui Huang, Limin Wang

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07207 2025-03-18 cs.CV cs.AI cs.CL 70%

Valley: Video Assistant with Large Language model Enhanced abilitY

Ruipu Luo, Ziwang Zhao, Min Yang, Zheming Yang, Minghui Qiu, Tao Wang, Zhongyu Wei, Yanhao Wang, Cen Chen

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09837 2025-03-17 cs.CV cs.AI cs.CL 70%

On the Limitations of Vision-Language Models in Understanding Image Transforms

Ahmad Mustafa Anis, Hasnain Ali, Saquib Sarfraz

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

Comments 8 pages, 15 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09613 2024-12-13 cs.CV 70%

PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models

Chenyu Yang, Xuan Dong, Xizhou Zhu, Weijie Su, Jiahao Wang, Hao Tian, Zhe Chen, Wenhai Wang, Lewei Lu, Jifeng Dai

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06040 2024-10-28 cs.CV 70%

Vript: A Video Is Worth Thousands of Words

Dongjie Yang, Suyuan Huang, Chengqiang Lu, Xiaodong Han, Haoxin Zhang, Yan Gao, Yao Hu, Hai Zhao

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by NeurIPS Dataset & Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11702 2024-10-16 cs.CV 70%

It's Just Another Day: Unique Video Captioning by Discriminative Prompting

Toby Perrett, Tengda Han, Dima Damen, Andrew Zisserman

专题命中 视频理解 :text-to-video(abstract);long video(abstract);分类 cs.CV

Comments ACCV 2024 Oral. Project page: https://tobyperrett.github.io/its-just-another-day/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04732 2024-09-13 cs.CV cs.AI 70%

VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery

Mohammadmahdi Honarmand, Muhammad Abdullah Jamal, Omid Mohareri

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16994 2024-04-30 cs.CV 70%

PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning

Lin Xu, Yilin Zhao, Daquan Zhou, Zhijie Lin, See Kiong Ng, Jiashi Feng

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07976 2024-04-22 cs.CV 70%

On the Pitfalls of Batch Normalization for End-to-End Video Learning: A Study on Surgical Workflow Analysis

Dominik Rivoir, Isabel Funke, Stefanie Speidel

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted at Medical Image Analysis (MedIA). Publication link: https://www.sciencedirect.com/science/article/pii/S1361841524000513

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02257 2024-04-08 cs.CV 70%

SnAG: Scalable and Accurate Video Grounding

Fangzhou Mu, Sicheng Mo, Yin Li

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Code available at https://github.com/fmu2/snag_release

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00308 2024-04-02 cs.CV 70%

ST-LLM: Large Language Models Are Effective Temporal Learners

Ruyang Liu, Chen Li, Haoran Tang, Yixiao Ge, Ying Shan, Ge Li

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19221 2024-03-29 cs.CV cs.AI 70%

Towards Multimodal Video Paragraph Captioning Models Robust to Missing Modality

Sishuo Chen, Lei Li, Shuhuai Ren, Rundong Gao, Yuanxin Liu, Xiaohan Bi, Xu Sun, Lu Hou

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Code available at https://github.com/lancopku/MR-VPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12370 2023-03-29 cs.CV 70%

Weakly Supervised Video Representation Learning with Unaligned Text for Sequential Videos

Sixun Dong, Huazhang Hu, Dongze Lian, Weixin Luo, Yicheng Qian, Shenghua Gao

专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);分类 cs.CV

Comments CVPR 2023. Code: https://github.com/svip-lab/WeakSVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11507 2023-01-30 cs.CV cs.CL cs.LG 70%

Semi-Parametric Video-Grounded Text Generation

Sungdong Kim, Jin-Hwa Kim, Jiyoung Lee, Minjoon Seo

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Preprint (16 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04501 2022-12-09 cs.CV 70%

Learning Video Representations from Large Language Models

Yue Zhao, Ishan Misra, Philipp Krähenbühl, Rohit Girdhar

专题命中 视频理解 :video-language(abstract);long video(abstract);分类 cs.CV

Comments Tech report. Project page: https://facebookresearch.github.io/LaViLa; Code is available at http://github.com/facebookresearch/LaViLa

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03191 2022-12-08 cs.CV 70%

InternVideo: General Video Foundation Models via Generative and Discriminative Learning

Yi Wang, Kunchang Li, Yizhuo Li, Yinan He, Bingkun Huang, Zhiyu Zhao, Hongjie Zhang, Jilan Xu, Yi Liu, Zun Wang, Sen Xing, Guo Chen, Junting Pan, Jiashuo Yu, Yali Wang, Limin Wang, Yu Qiao

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏