arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 210 信号源:cs.CV, eess.IV, cs.MM

1. 视频问答 210 篇

2301.07463 2023-01-19 cs.CV cs.AI 85%

Temporal Perceiving Video-Language Pre-training

Fan Ma, Xiaojie Jin, Heng Wang, Jingjia Huang, Linchao Zhu, Jiashi Feng, Yi Yang

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20180 2026-05-08 cs.CV cs.AI cs.CL 84%

Adaptive Greedy Frame Selection for Long Video Understanding

自适应贪心帧选择用于长视频理解

Yuning Huang, Xiaoyu Ji, Joseph Huang, Yichi Zhang, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 视频问答 :video understanding(title);long video(title);分类 cs.CV

AI总结 本文提出一种自适应贪心帧选择方法,在固定帧预算下联合优化查询相关性和语义代表性,通过构建1FPS候选池并嵌入两种互补空间,提升长视频问答的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17743 2026-01-27 cs.CV 84%

VideoPro: Adaptive Program Reasoning for Long Video Understanding

VideoPro: 针对长视频理解的自适应程序推理

Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频问答 :video understanding(title);long video(title);分类 cs.CV

AI总结 VideoPro通过自适应程序推理框架提升长视频理解的效率和可靠性,利用快慢推理机制和参数优化在视觉任务中取得更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 83%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29402 2026-05-29 cs.CV cs.AI 83%

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge

面向高效长视频推理的语义与视觉证据:HD-EPIC VQA挑战赛的解决方案

Yinsong Xu, Wei Jing, Liuxin Zhang, Wanjun Lv, Hui Li

机构 * Lenovo, China(联想(中国))

专题命中 视频问答 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出一种统一框架,通过解耦长视频推理为语义证据(粗到细提取全局过程结构)和视觉证据(基于目标的细粒度定位),并采用查询条件证据检索与整合,在HD-EPIC VQA挑战赛中取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 83%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视频问答 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04349 2026-03-05 cs.CV 83%

FocusGraph: Graph-Structured Frame Selection for Embodied Long Video Question Answering

FocusGraph: 用于具身长视频问答的图结构帧选择

Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko, Ekaterina Derevyanka, Dmitry Yudin

机构 * AXXX MIRAI Yandex FusionBrain Lab(FusionBrain实验室)

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 FocusGraph通过图结构帧选择和轻量级模型实现高效长视频问答,提升性能并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13444 2026-02-24 cs.CV cs.AI 83%

VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning

VideoMind: 一种用于时序 grounded 视频推理的链式 LoRA 代理

Ye Liu, Kevin Qinghong Lin, Chang Wen Chen, Mike Zheng Shou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频问答 :video reasoning(title,abstract);video-language(abstract);分类 cs.CV

AI总结 VideoMind 提出了一种基于角色的链式 LoRA 机制,用于提升视频时序 grounded 推理的效率与灵活性。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03009 2025-08-06 cs.CV cs.AI 83%

Enhancing Long Video Question Answering with Scene-Localized Frame Grouping

Xuyi Yang, Wenhao Zhang, Hongbo Jin, Lin Liu, Hongbo Xu, Yongwei Nie, Fei Yu, Fei Ma

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05889 2025-03-21 cs.CV cs.AI cs.CL 83%

CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion

Shoubin Yu, Jaehong Yoon, Mohit Bansal

专题命中 视频问答 :video-language(title,abstract);video reasoning(abstract);分类 cs.CV

Comments ICLR 2025; first two authors contributed equally. Project page: https://CREMA-VideoLLM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19941 2024-12-02 cs.CV cs.CL cs.LG 83%

Perception Test 2024: Challenge Summary and a Novel Hour-Long VideoQA Benchmark

Joseph Heyward, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2312.13090

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09380 2024-10-15 cs.CV cs.AI 83%

Prompting Video-Language Foundation Models with Domain-specific Fine-grained Heuristics for Video Question Answering

Ting Yu, Kunhao Fu, Shuhui Wang, Qingming Huang, Jun Yu

专题命中 视频问答 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments IEEE Transactions on Circuits and Systems for Video Technology

Journal ref IEEE Transactions on Circuits and Systems for Video Technology, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13546 2024-08-27 cs.CL cs.CV 83%

LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs

Yunxin Li, Xinyu Chen, Baotain Hu, Min Zhang

专题命中 视频问答 :long video(title,abstract);video understanding(abstract);分类 cs.CV

Comments 12 pages; working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17267 2023-11-30 cs.CV 83%

E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer

Jacob Zhiyuan Fang, Skyler Zheng, Vasu Sharma, Robinson Piramuthu

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10111 2023-11-20 cs.CV cs.AI cs.CL cs.LG 83%

VideoCon: Robust Video-Language Alignment via Contrast Captions

Hritik Bansal, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang, Aditya Grover

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

Comments 22 pages, 19 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01540 2023-06-02 cs.CV 83%

An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling

Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

Comments CVPR'23; the first two authors contributed equally; code is available at https://github.com/tsujuifu/pytorch_empirical-mvm

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.07885 2022-12-21 cs.CV 83%

Clover: Towards A Unified Video-Language Alignment and Fusion Model

Jingjia Huang, Yinan Li, Jiashi Feng, Xinglong Wu, Xiaoshuai Sun, Rongrong Ji

专题命中 视频问答 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

Comments Update Tri-modal Alignment task

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11446 2022-12-01 cs.CV cs.AI cs.CL 83%

SMAUG: Sparse Masked Autoencoder for Efficient Video-Language Pre-training

Yuanze Lin, Chen Wei, Huiyu Wang, Alan Yuille, Cihang Xie

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05039 2022-10-12 cs.LG cs.CV 83%

Contrastive Video-Language Learning with Fine-grained Frame Sampling

Zixu Wang, Yujie Zhong, Yishu Miao, Lin Ma, Lucia Specia

专题命中 视频问答 :video-language(title,abstract);long video(abstract);分类 cs.CV

Comments AACL-IJCNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07160 2022-06-16 cs.CV 83%

LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling

Linjie Li, Zhe Gan, Kevin Lin, Chung-Ching Lin, Zicheng Liu, Ce Liu, Lijuan Wang

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01720 2022-06-06 cs.CV cs.AI cs.CL cs.LG 83%

Revisiting the "Video" in Video-Language Understanding

Shyamal Buch, Cristóbal Eyzaguirre, Adrien Gaidon, Jiajun Wu, Li Fei-Fei, Juan Carlos Niebles

专题命中 视频问答 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

Comments CVPR 2022 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04302 2026-08-06 cs.CV cs.IR cs.MM 新提交 81%

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

CLIP-CC-Bench:评估视频语言模型中的段落级视频描述

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack

机构 * South Dakota State University(南达科他州立大学)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV、cs.MM

AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。

Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19532 2024-10-01 cs.CV cs.CL cs.LG cs.MM 81%

Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding

Xiao Wang, Jianlong Wu, Zijia Lin, Fuzheng Zhang, Di Zhang, Liqiang Nie

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV、cs.MM

Comments Under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16189 2026-07-20 cs.CV 新提交 79%

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

将视频搜索为树:用于有基础的长视频问答的自校正智能体

Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Sony(索尼)

专题命中 视频问答 :long video(title,abstract);分类 cs.CV

AI总结 研究有基础的长视频问答问题,提出VideoTreeSearch框架,通过构建自适应时间树及可学习的离散操作让智能体导航,经监督微调与强化学习训练,在多个基准测试中表现出色,证明自校正分层搜索是关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24563 2026-07-16 cs.CV cs.CL 版本更新 79%

NeMo: Needle in a Montage for Video-Language Understanding

NeMo:视频语言理解中的蒙太奇之针

Zi-Yuan Hu, Shuo Liang, Duo Zheng, Yanyang Li, Yeyao Tao, Shijia Huang, Wei Feng, Jia Qin, Jianguang Yu, Jing Huang, Meng Fang, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Phoenix TV(凤凰电视台) Stanford University(斯坦福大学) University of Liverpool(利物浦大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG 79%

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

专题命中 视频问答 :video understanding(title);video reasoning(abstract);分类 cs.CV

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01662 2026-05-05 cs.CV 79%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 视频问答 :video understanding(title);video generation(abstract);分类 cs.CV

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 79%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频问答 :video-language(title,abstract);分类 cs.CV

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17736 2026-02-04 cs.CV cs.AI cs.CL 79%

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互

Yiming Zhao, Yu Zeng, Yukun Qi, YaoYang Liu, Xikun Bao, Lin Chen, Zehui Chen, Qing Miao, Chenxi Liu, Jie Zhao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 视频问答 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。

Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 79%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视频问答 :video reasoning(title,abstract);分类 cs.CV

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏