arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6759 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

2504.10920 2025-04-16 cs.CV 57%

Towards Efficient Partially Relevant Video Retrieval with Active Moment Discovering

Peipei Song, Long Zhang, Long Lan, Weidong Chen, Dan Guo, Xun Yang, Meng Wang

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Multimedia (TMM) on January 19, 2025. The code is available at https://github.com/songpipi/AMDNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10049 2025-04-15 cs.CV cs.CL 57%

Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure

Théo Gigant, Camille Guinaudeau, Frédéric Dufaux

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08384 2025-04-14 cs.CV 57%

Towards Efficient and Robust Moment Retrieval System: A Unified Framework for Multi-Granularity Models and Temporal Reranking

Huu-Loc Tran, Tinh-Anh Nguyen-Nhu, Huu-Phong Phan-Nguyen, Tien-Huy Nguyen, Nhat-Minh Nguyen-Dich, Anh Dao, Huy-Duc Do, Quan Nguyen, Hoang M. Le, Quang-Vinh Dinh

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13983 2025-04-14 cs.CV 57%

SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability

Jiankang Wang, Zhihan Zhang, Zhihang Liu, Yang Li, Jiannan Ge, Hongtao Xie, Yongdong Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06357 2025-04-10 cs.CV cs.LG 57%

From Broadcast to Minimap: Achieving State-of-the-Art SoccerNet Game State Reconstruction

Vladimir Golovkin, Nikolay Nemtsev, Vasyl Shandyba, Oleg Udin, Nikita Kasatkin, Pavel Kononov, Anton Afanasiev, Sergey Ulasen, Andrei Boiarov

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for presentation at the CVPR 2025 CVsports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05463 2025-04-09 cs.CV 57%

REVEAL: Relation-based Video Representation Learning for Video-Question-Answering

Sofian Chaybouti, Walid Bousselham, Moritz Wolter, Hilde Kuehne

专题命中 视频理解 :video language model(abstract);分类 cs.CV

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01890 2025-04-08 cs.CV 57%

Is Temporal Prompting All We Need For Limited Labeled Action Recognition?

Shreyank N Gowda, Boyan Gao, Xiao Gu, Xiaobo Jin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in CVPR-W 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06581 2025-04-08 cs.NI cs.CV cs.LG 57%

A Survey on Video Analytics in Cloud-Edge-Terminal Collaborative Systems

Linxiao Gong, Hao Yang, Gaoyun Fang, Bobo Ju, Juncen Guo, Xiaoguang Zhu, Xiping Hu, Yan Wang, Peng Sun, Azzedine Boukerche

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02397 2025-04-04 cs.CV 57%

Learning Audio-guided Video Representation with Gated Attention for Video-Text Retrieval

Boseung Jeong, Jicheol Park, Sungyeon Kim, Suha Kwak

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02286 2025-04-04 cs.CV 57%

Moment Quantization for Video Temporal Grounding

Xiaolong Sun, Le Wang, Sanping Zhou, Liushuai Shi, Kun Xia, Mengnan Liu, Yabing Wang, Gang Hua

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01328 2025-04-03 cs.CV 57%

Slow-Fast Architecture for Video Multi-Modal Large Language Models

Min Shi, Shihao Wang, Chieh-Yun Chen, Jitesh Jain, Kai Wang, Junjun Xiong, Guilin Liu, Zhiding Yu, Humphrey Shi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24096 2025-04-01 cs.CV 57%

DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description

Adrienne Deganutti, Simon Hadfield, Andrew Gilbert

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19706 2025-04-01 cs.CV cs.AI 57%

Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025 Camera-ready, 18 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00161 2025-04-01 cs.CV cs.LG 57%

STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training

Haiyi Qiu, Minghe Gao, Long Qian, Kaihang Pan, Qifan Yu, Juncheng Li, Wenjie Wang, Siliang Tang, Yueting Zhuang, Tat-Seng Chua

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22233 2025-04-01 cs.CV cs.AI cs.IR 57%

ContextIQ: A Multimodal Expert-Based Video Retrieval System for Contextual Advertising

Ashutosh Chaubey, Anoubhav Agarwaal, Sartaki Sinha Roy, Aayush Agrawal, Susmita Ghose

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02071 2025-03-27 cs.CV 57%

Progress-Aware Video Frame Captioning

Zihui Xue, Joungbin An, Xitong Yang, Kristen Grauman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025, Project website: https://vision.cs.utexas.edu/projects/ProgressCaptioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09390 2025-03-27 cs.CV cs.LG 57%

LLAVIDAL: A Large LAnguage VIsion Model for Daily Activities of Living

Dominick Reilly, Rajatsubhra Chakraborty, Arkaprava Sinha, Manish Kumar Govind, Pu Wang, Francois Bremond, Le Xue, Srijan Das

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 57%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18808 2025-03-25 cs.CV 57%

CRCL: Causal Representation Consistency Learning for Anomaly Detection in Surveillance Videos

Yang Liu, Hongjin Wang, Zepu Wang, Xiaoguang Zhu, Jing Liu, Peng Sun, Rui Tang, Jianwei Du, Victor C. M. Leung, Liang Song

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for publication by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18637 2025-03-25 cs.CV 57%

Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks

Nina Shvetsova, Arsha Nagrani, Bernt Schiele, Hilde Kuehne, Christian Rupprecht

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments To be published at CVPR 2025, project webpage https://utd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16848 2025-03-25 cs.CV 57%

Multiple Object Tracking as ID Prediction

Ruopeng Gao, Ji Qi, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17827 2025-03-25 cs.CV 57%

4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding

Wenxuan Zhu, Bing Li, Cheng Zheng, Jinjie Mai, Jun Chen, Letian Jiang, Abdullah Hamdi, Sara Rojas Martinez, Chia-Wen Lin, Mohamed Elhoseiny, Bernard Ghanem

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08326 2025-03-25 cs.CV 57%

Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks

Miran Heo, Min-Hung Chen, De-An Huang, Sifei Liu, Subhashree Radhakrishnan, Seon Joo Kim, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2025, Project page: https://miranheo.github.io/omni-rgpt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16036 2025-03-21 cs.CV cs.AI cs.CL 57%

Hybrid-Level Instruction Injection for Video Token Compression in Multi-modal Large Language Models

Zhihang Liu, Chen-Wei Xie, Pandeng Li, Liming Zhao, Longxiang Tang, Yun Zheng, Chuanbin Liu, Hongtao Xie

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18908 2025-03-21 cs.LG cs.CL cs.CV 57%

Wolf: Dense Video Captioning with a World Summarization Framework

Boyi Li, Ligeng Zhu, Ran Tian, Shuhan Tan, Yuxiao Chen, Yao Lu, Yin Cui, Sushant Veer, Max Ehrlich, Jonah Philion, Xinshuo Weng, Fuzhao Xue, Linxi Fan, Yuke Zhu, Jan Kautz, Andrew Tao, Ming-Yu Liu, Sanja Fidler, Boris Ivanovic, Trevor Darrell, Jitendra Malik, Song Han, Marco Pavone

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13724 2025-03-19 cs.CV 57%

Towards Scalable Modeling of Compressed Videos for Efficient Action Recognition

Shristi Das Biswas, Efstathia Soufleri, Arani Roy, Kaushik Roy

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21113 2025-03-19 cs.CV cs.CL 57%

Zero-Shot Action Recognition in Surveillance Videos

Joao Pereira, Vasco Lopes, David Semedo, Joao Neves

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12332 2025-03-18 cs.CV 57%

VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining

Yunze Liu, Peiran Wu, Cheng Liang, Junxiao Shen, Limin Wang, Li Yi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11205 2025-03-17 cs.CV 57%

LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs

Leqi Shen, Tao He, Guoqiang Gong, Fan Yang, Yifeng Zhang, Pengzhang Liu, Sicheng Zhao, Guiguang Ding

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13317 2025-03-14 cs.CV 57%

Teaching VLMs to Localize Specific Objects from In-context Examples

Sivan Doveh, Nimrod Shabtay, Wei Lin, Eli Schwartz, Hilde Kuehne, Raja Giryes, Rogerio Feris, Leonid Karlinsky, James Glass, Assaf Arbelle, Shimon Ullman, M. Jehanzeb Mirza

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏