arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6759 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1375 篇

1711.06354 2017-11-20 cs.CV 57%

Grounded Objects and Interactions for Video Captioning

Chih-Yao Ma, Asim Kadav, Iain Melvin, Zsolt Kira, Ghassan AlRegib, Hans Peter Graf

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:1711.06330

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.06923 2017-11-15 cs.CV stat.ML 57%

Multi-kernel learning of deep convolutional features for action recognition

Biswa Sengupta, Yu Qian

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ICCV 2017 Workshop on Video and Language Understanding: MovieQA and the Large Scale Movie Description Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.01714 2017-11-07 cs.CV 57%

End-to-End Video Classification with Knowledge Graphs

Fang Yuan, Zhe Wang, Jie Lin, Luis Fernando D'Haro, Kim Jung Jae, Zeng Zeng, Vijay Chandrasekhar

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.10206 2017-10-02 cs.MM 57%

Impact of Three-Dimensional Video Scalability on Multi-View Activity Recognition using Deep Learning

Jun-Ho Choi, Manri Cheon, Min-Su Choi, Jong-Seok Lee

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

Comments Accepted as a Thematic Workshops paper at ACM MM 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.04589 2017-09-08 cs.CV 57%

Learning without Prejudice: Avoiding Bias in Webly-Supervised Action Recognition

Christian Rupprecht, Ansh Kapil, Nan Liu, Lamberto Ballan, Federico Tombari

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Submitted to CVIU SI: Computer Vision and the Web

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09074 2017-07-31 cs.CV 57%

Learning from Video and Text via Large-Scale Discriminative Clustering

Antoine Miech, Jean-Baptiste Alayrac, Piotr Bojanowski, Ivan Laptev, Josef Sivic

专题命中 视频理解 :text-to-video(abstract);分类 cs.CV

Comments To appear in ICCV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.01408 2017-07-26 cs.CV 57%

Video Representation Learning and Latent Concept Mining for Large-scale Multi-label Video Classification

Po-Yao Huang, Ye Yuan, Zhenzhong Lan, Lu Jiang, Alexander G. Hauptmann

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.04272 2017-07-17 cs.CV 57%

Cultivating DNN Diversity for Large Scale Video Labelling

Mikel Bober-Irizar, Sameed Husain, Eng-Jon Ong, Miroslaw Bober

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments CVPR 2017 Youtube-8M Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.04572 2017-06-15 stat.ML cs.CV cs.LG 57%

Deep Learning Methods for Efficient Large Scale Video Labeling

Miha Skalic, Marcin Pekalski, Xingguo E. Pan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 7 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.10420 2017-05-31 cs.CV 57%

Discriminatively Learned Hierarchical Rank Pooling Networks

Basura Fernando, Stephen Gould

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments International Journal of Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.05165 2017-04-19 cs.CV 57%

Video Object Segmentation using Supervoxel-Based Gerrymandering

Brent A. Griffin, Jason J. Corso

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.06950 2017-04-18 cs.CV 57%

Temporal Tessellation: A Unified Approach for Video Analysis

Dotan Kaufman, Gil Levi, Tal Hassner, Lior Wolf

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.03246 2017-04-07 cs.CV 57%

Ordered Pooling of Optical Flow Sequences for Action Recognition

Jue Wang, Anoop Cherian, Fatih Porikli

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted in WACV 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.00423 2017-03-14 cs.CV 57%

Towards Reading Hidden Emotions: A comparative Study of Spontaneous Micro-expression Spotting and Recognition Methods

Xiaobai Li, Xiaopeng Hong, Antti Moilanen, Xiaohua Huang, Tomas Pfister, Guoying Zhao, Matti Pietikäinen

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.06182 2016-12-06 cs.CV 57%

The THUMOS Challenge on Action Recognition for Videos "in the Wild"

Haroon Idrees, Amir R. Zamir, Yu-Gang Jiang, Alex Gorban, Ivan Laptev, Rahul Sukthankar, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Preprint submitted to Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.01376 2016-11-11 cs.CV 57%

Recognizing and Presenting the Storytelling Video Structure with Deep Multimodal Networks

Lorenzo Baraldi, Costantino Grana, Rita Cucchiara

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.05177 2016-07-19 cs.CV 57%

Query-Focused Extractive Video Summarization

Aidean Sharghi, Boqing Gong, Mubarak Shah

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Accepted to ECCV 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.09439 2016-04-04 cs.CV 57%

The Open World of Micro-Videos

Phuc Xuan Nguyen, Gregory Rogez, Charless Fowlkes, Deva Ramanan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.07314 2015-12-24 cs.CV 57%

Mid-level Representation for Visual Recognition

Moin Nabi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.03825 2015-05-15 cs.CV 57%

Unsupervised Object Discovery and Tracking in Video Collections

Suha Kwak, Minsu Cho, Ivan Laptev, Jean Ponce, Cordelia Schmid

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.03069 2015-02-10 cs.CV 57%

Learning from Multiple Sources for Video Summarisation

Xiatian Zhu, Chen Change Loy, Shaogang Gong

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1501.07738 2015-02-02 cs.CV 57%

Co-Regularized Deep Representations for Video Summarization

Olivier Morère, Hanlin Goh, Antoine Veillard, Vijay Chandrasekhar, Jie Lin

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments Video summarization, deep convolutional neural networks, co-regularized restricted Boltzmann machines

详情

展开后加载摘要…

URL PDF HTML 收藏
1411.0085 2014-11-04 cs.CV 57%

Complex Events Recognition under Uncertainty in a Sensor Network

Atul Kanaujia, Tae Eun Choe, Hongli Deng

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21267 2026-07-24 cs.AI 新提交 50%

BasketEvent: Understanding Who Did What and When in Basketball Videos

BasketEvent:理解篮球视频中谁在何时做了什么

Yu Zhang, Jiayuan Rao, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视频理解 :video understanding(abstract)

AI总结 该研究旨在解决篮球视频理解问题,提出以球员为中心的BasketEvent数据集,引入PlayNet推理框架,通过建模多种互动并聚合时间证据进行事件预测,实验证明其在体育视频理解上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15859 2026-06-16 cs.AR 新提交 50%

EPIC: A System Framework for Efficient Egocentric Perception on Embodied AR Glasses

EPIC:面向具身AR眼镜的高效自我中心感知系统框架

Tianhua Xia, Haiyu Wang, Jiajing Zheng, Su Chen, Sai Qian Zhang

专题命中 视频理解 :video understanding(abstract)

AI总结 提出EPIC系统,通过算法-硬件协同优化,利用注视、姿态和惯性信号推断用户意图,仅保留高分辨率感知输入中最具信息量的部分,平均减少27.5倍内存占用和24.3倍能耗,同时保持自我中心视频理解任务的智能辅助精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视频理解 :video understanding(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07049 2026-06-05 cs.NE cs.LG 50%

GridPE: A Grid Cell-Inspired Unified Position Embedding for Arbitrary-Dimensional Spaces

GridPE: 一种基于网格细胞的统一位置嵌入方法用于任意维度空间

Boyang Li, Yulin Wu, Nuoxian Huang, Wenjia Zhang

机构 * New York University(纽约大学) Peking University(北京大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出GridPE,一种受哺乳动物空间认知中六边形周期编码启发的新型位置嵌入框架,旨在解决高维时空任务中位置嵌入的理论保障问题,通过结合计算神经科学原理和调和分析,为任意维度空间提供统一的位置嵌入解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04596 2026-06-04 cs.CL 50%

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

多视频摘要中位置偏差的系统评估:基于多模态大语言模型

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(未来科学国际中心)

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究系统评估了多模态大语言模型在多视频摘要任务中的位置偏差,通过构建基准和三种互补指标揭示了领域与模型依赖的偏差特性,并分析了提示级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04804 2026-05-14 cs.CL 50%

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型

Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) Nanjing University(南京大学) The Hong Kong University of Science(香港科学大学) Sichuan University(四川大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。

Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05650 2026-04-10 cs.CL 50%

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

见林木而非树木:通过视觉-语义引导实现松散推测解码以提高视频大语言模型的推理效率

Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li

机构 * ZJU(浙江大学) BUPT(北京邮电大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出LVSpec,一种无需训练的松散推测解码框架,通过视觉相关锚点识别和位置移位容忍机制,提升视频大语言模型的推理速度和精度。

Comments ACL'2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏