arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-16 至 2026-04-16 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2602.20913 2026-04-16 cs.CV 88%

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24869 2026-04-16 cs.CV 85%

SiLVR: A Simple Language-based Video Reasoning Framework

SiLVR:一种简单的基于语言的视频推理框架

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius

机构 * Department of Computer Science(计算机科学系) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。

Comments Accepted by TMLR (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 70%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 57%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏