arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1375 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

2503.06170 2025-03-13 cs.AI cs.CV cs.RO 57%

Object-Centric World Model for Language-Guided Manipulation

Youngjoon Jeong, Junha Chun, Soonwoo Cha, Taesup Kim

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08335 2025-03-12 cs.CV 57%

Prompt2LVideos: Exploring Prompts for Understanding Long-Form Multimodal Videos

Soumya Shamarao Jahagirdar, Jayasree Saha, C V Jawahar

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVIP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10443 2025-03-12 cs.CV cs.AI 57%

SweetTok: Semantic-Aware Spatial-Temporal Tokenizer for Compact Video Discretization

Zhentao Tan, Ben Xue, Jian Jia, Junhao Wang, Wencai Ye, Shaoyun Shi, Mingjie Sun, Wenjin Wu, Quan Chen, Peng Jiang

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00986 2025-03-04 cs.CV 57%

Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning

Baoqi Pei, Yifei Huang, Jilan Xu, Guo Chen, Yuping He, Lijin Yang, Yali Wang, Weidi Xie, Yu Qiao, Fei Wu, Limin Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12961 2025-02-28 cs.CV 57%

Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution

Zuyan Liu, Yuhao Dong, Ziwei Liu, Winston Hu, Jiwen Lu, Yongming Rao

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03879 2025-02-27 cs.SD cs.MM eess.AS 57%

SONIQUE: Video Background Music Generation Using Unpaired Audio-Visual Data

Liqian Zhang, Magdalena Fuentes

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

Comments The paper has been accepted for ICASSP 2025, updating the latest camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06006 2025-02-18 cs.CV cs.AI 57%

SoccerNet 2023 Challenges Results

Anthony Cioppa, Silvio Giancola, Vladimir Somers, Floriane Magera, Xin Zhou, Hassan Mkhallati, Adrien Deliège, Jan Held, Carlos Hinojosa, Amir M. Mansourian, Pierre Miralles, Olivier Barnich, Christophe De Vleeschouwer, Alexandre Alahi, Bernard Ghanem, Marc Van Droogenbroeck, Abdullah Kamal, Adrien Maglo, Albert Clapés, Amr Abdelaziz, Artur Xarles, Astrid Orcesi, Atom Scott, Bin Liu, Byoungkwon Lim, Chen Chen, Fabian Deuser, Feng Yan, Fufu Yu, Gal Shitrit, Guanshuo Wang, Gyusik Choi, Hankyul Kim, Hao Guo, Hasby Fahrudin, Hidenari Koguchi, Håkan Ardö, Ibrahim Salah, Ido Yerushalmy, Iftikar Muhammad, Ikuma Uchida, Ishay Be'ery, Jaonary Rabarisoa, Jeongae Lee, Jiajun Fu, Jianqin Yin, Jinghang Xu, Jongho Nang, Julien Denize, Junjie Li, Junpei Zhang, Juntae Kim, Kamil Synowiec, Kenji Kobayashi, Kexin Zhang, Konrad Habel, Kota Nakajima, Licheng Jiao, Lin Ma, Lizhi Wang, Luping Wang, Menglong Li, Mengying Zhou, Mohamed Nasr, Mohamed Abdelwahed, Mykola Liashuha, Nikolay Falaleev, Norbert Oswald, Qiong Jia, Quoc-Cuong Pham, Ran Song, Romain Hérault, Rui Peng, Ruilong Chen, Ruixuan Liu, Ruslan Baikulov, Ryuto Fukushima, Sergio Escalera, Seungcheon Lee, Shimin Chen, Shouhong Ding, Taiga Someya, Thomas B. Moeslund, Tianjiao Li, Wei Shen, Wei Zhang, Wei Li, Wei Dai, Weixin Luo, Wending Zhao, Wenjie Zhang, Xinquan Yang, Yanbiao Ma, Yeeun Joo, Yingsen Zeng, Yiyang Gan, Yongqiang Zhu, Yujie Zhong, Zheng Ruan, Zhiheng Li, Zhijian Huang, Ziyu Meng

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07161 2025-02-12 cs.CV cs.AI 57%

A Survey on Mamba Architecture for Vision Applications

Fady Ibrahim, Guangjun Liu, Guanghui Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00094 2025-02-06 cs.CV cs.AI cs.CL cs.HC cs.LG 57%

AIN: The Arabic INclusive Large Multimodal Model

Ahmed Heakl, Sara Ghaboura, Omkar Thawkar, Fahad Shahbaz Khan, Hisham Cholakkal, Rao Muhammad Anwer, Salman Khan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 20 pages, 16 figures, ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11007 2025-02-04 cs.CV cs.LG 57%

HFGCN:Hypergraph Fusion Graph Convolutional Networks for Skeleton-Based Action Recognition

Pengcheng Dong, Wenbo Wan, Huaxiang Zhang, Shuai Li, Sujuan Hou, Jiande Sun

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11513 2025-02-03 cs.CV cs.AI 57%

Mamba Fusion: Learning Actions Through Questioning

Zhikang Dong, Apoorva Beedu, Jason Sheinkopf, Irfan Essa

专题命中 视频理解 :video language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07810 2025-01-15 cs.CV 57%

AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation

Sitong Gong, Yunzhi Zhuge, Lu Zhang, Yifan Wang, Pingping Zhang, Lijun Wang, Huchuan Lu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07087 2025-01-14 cs.CV cs.AI 57%

Video Quality Assessment for Online Processing: From Spatial to Temporal Sampling

Jiebin Yan, Lei Wu, Yuming Fang, Xuelin Liu, Xue Xia, Weide Liu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22829 2025-01-14 cs.CV 57%

Situational Scene Graph for Structured Human-centric Situation Understanding

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06761 2025-01-14 cs.CV 57%

VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning

Ji Soo Lee, Jongha Kim, Jeehye Na, Jinyoung Park, Hyunwoo J. Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05901 2025-01-14 cs.CV 57%

Valley2: Exploring Multimodal Models with Scalable Vision-Language Design

Ziheng Wu, Zhenghao Chen, Ruipu Luo, Can Zhang, Yuan Gao, Zhentao He, Xian Wang, Haoran Lin, Minghui Qiu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05717 2025-01-13 cs.CV cs.AI q-bio.QM 57%

Zero-shot Shark Tracking and Biometrics from Aerial Imagery

Chinmay K Lalgudi, Mark E Leone, Jaden V Clark, Sergio Madrigal-Mora, Mario Espinoza

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06433 2025-01-13 cs.CV cs.AI cs.LG 57%

Self-supervised video pretraining yields robust and more human-aligned visual representations

Nikhil Parthasarathy, S. M. Ali Eslami, João Carreira, Olivier J. Hénaff

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to 37th Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00432 2025-01-03 cs.CV cs.LG 57%

OV-HHIR: Open Vocabulary Human Interaction Recognition Using Cross-modal Integration of Large Language Models

Lala Shakti Swarup Ray, Bo Zhou, Sungho Suh, Paul Lukowicz

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted in IEEE ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00136 2025-01-03 cs.CV cs.AI cs.LG 57%

Detection-Fusion for Knowledge Graph Extraction from Videos

Taniya Das, Louis Mahon, Thomas Lukasiewicz

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 12 pages, To be submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 57%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16946 2024-12-24 cs.CV 57%

Video Domain Incremental Learning for Human Action Recognition in Home Environments

Yuanda Hu, Xing Liu, Meiying Li, Yate Ge, Xiaohua Sun, Weiwei Guo

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16117 2024-12-23 cs.CV 57%

PruneVid: Visual Token Pruning for Efficient Video Large Language Models

Xiaohu Huang, Hao Zhou, Kai Han

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Efficient Video Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14006 2024-12-19 cs.CV 57%

InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models

Cong Wei, Yujie Zhong, Haoxian Tan, Yingsen Zeng, Yong Liu, Zheng Zhao, Yujiu Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12675 2024-12-18 cs.CV 57%

ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries

Wangyu Xue, Chen Qian, Jiayi Wu, Yang Zhou, Wentao Liu, Ju Ren, Siming Fan, Yaoxue Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11228 2024-12-17 cs.CV cs.AI cs.LG 57%

Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition

Yulin Wang, Haoji Zhang, Yang Yue, Shiji Song, Chao Deng, Junlan Feng, Gao Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IEEE TPAMI. Journal version of arXiv:2105.03245 (AdaFocusV1, ICCV 2021 Oral), arXiv:2112.14238 (AdaFocusV2, CVPR 2022), and arXiv:2209.13465 (AdaFocusV3, ECCV 2022). Code and pre-trained models: https://github.com/LeapLabTHU/Uni-AdaFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12519 2024-12-10 cs.CV 57%

Dynamics Based Neural Encoding with Inter-Intra Region Connectivity

Mai Gamal, Mohamed Rashad, Eman Ehab, Seif Eldawlatly, Mennatullah Siam

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Title change

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19644 2024-11-28 cs.CV cs.AI cs.LG 57%

EgoSurgery-Phase: A Dataset of Surgical Phase Recognition from Egocentric Open Surgery Videos

Ryo Fujii, Masashi Hatano, Hideo Saito, Hiroki Kajita

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Early accepted by MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14205 2024-11-22 cs.CV cs.AI 57%

Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body

Zeqing Wang, Qingyang Ma, Wentao Wan, Haojie Li, Keze Wang, Yonghong Tian

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13683 2024-11-22 cs.CV 57%

Extending Video Masked Autoencoders to 128 frames

Nitesh Bharadwaj Gundavarapu, Luke Friedman, Raghav Goyal, Chaitra Hegde, Eirikur Agustsson, Sagar M. Waghmare, Mikhail Sirotenko, Ming-Hsuan Yang, Tobias Weyand, Boqing Gong, Leonid Sigal

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 10.5 pages of main paper, 25 pages total, 4 figures and 10 tables. To appear in NeurIPS'24

详情

展开后加载摘要…

URL PDF HTML 收藏