InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
Comments a technical report about video understanding (accepted to ECCV2024)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
Comments a technical report about video understanding (accepted to ECCV2024)
SurgNarrator:面向手术视频理解的生成式检索框架
机构 * University of Liverpool(利物浦大学) ; City University of Hong Kong(香港城市大学) ; University of Oxford(牛津大学) ; University of Strasbourg(斯特拉斯堡大学) ; IHU Strasbourg(斯特拉斯堡大学医院研究所) ; Imperial College London(帝国理工学院)
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。
Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
CADER:用于长视频理解的置信度感知动态证据推理
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。
VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。
EFlow: 学习证据流用于具有自适应反思的长视频推理
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 提出EFlow框架,通过分离时间定位与逻辑推理(CoT)及置信度感知的反思机制,解决长视频推理中早期语义假设导致的证据偏差问题,在五个基准上提升性能。
桥接视频理解与生成的统一框架
专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);分类 cs.CV
AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。
Comments technical blog
EgoVITA:学习规划与验证以实现自我中心视频推理
专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。
Comments ECCV 2026
置信度感知的工具编排用于鲁棒视频理解
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。
Comments Project page: https://rova-v2.github.io/
VideoLatent: 通过潜在自强制进行视频-语言学习
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI(微图AI)
专题命中 视频理解 :video-language(title);video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。
看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象
机构 * CUHK (SZ)(香港中文大学(深圳)) ; University of Cambridge(剑桥大学) ; UESTC(电子科技大学) ; CUHK(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。
Comments Accepted to CVPR 2026 (Highlight)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
从内容到知识:基于神经知识表示的闪电般快速长视频理解
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。
GOPAgen: 基于结构记忆与层次推理的运动感知高效智能长视频理解
机构 * Peking University(北京大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出GOPAgen方法,通过视频编解码的GOP运动代理、GOP树推理算法和结构记忆机制,实现高效长视频理解,在多个VQA基准上取得领先性能。
VideoKR:迈向知识和推理密集型视频理解
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学) ; University of Michigan(密歇根大学)
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出VideoKR,首个大规模训练语料库,通过人工参与的技能导向生成管道构建315K视频推理示例,增强知识和推理密集型视频理解,并在专家标注基准上验证其有效性。
Comments ICML 2026 Spotlight
TrajTok: 学习轨迹令牌以实现更好的视频理解
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; Apple(苹果公司) ; Woven by Toyota, Inc(丰田纺织公司)
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出TrajTok,一种端到端视频令牌化模块,通过隐式时空聚类生成对象轨迹令牌,提升视频理解效率与性能。
Comments CVPR 2026
VideoTemp-o3:在智能视频思考中协调时间定位与视频理解
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。
Comments ICML 2026
VideoOdyssey: 超长上下文与全模态视频理解基准
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) ; GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。
链式窥视:面向视频理解的搜索引导渐进性对象基础推理
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China.(网络与交换技术国家重点实验室,北京邮电大学,北京,中国) ; Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University, China.(大数据研究院,复旦大学计算机科学与人工智能学院,中国) ; ARC Lab, Tencent PCG, Shenzhen, China.(腾讯PCG深圳实验室,深圳,中国) ; School of Artificial Intelligence, Beijing University of Technology, Beijing, China.(北京理工大学人工智能学院,北京,中国)
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出Chain-of-Glimpse框架,通过搜索引导的渐进推理解决视频中对象变化问题,提升多步骤决策的准确性和可解释性。
Video-Zero: 自主进化视频理解
机构 * Tsinghua University(清华大学) ; Tencent(腾讯) ; Tongji University(同济大学) ; Peking University(北京大学)
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出Video-Zero框架,通过无标注的Questioner-Solver共进化机制,聚焦时间局部证据,提升视频理解的自进化能力,验证了证据中心自进化方法的有效性与迁移性。
EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。
Comments The first two authors contributed equally. Project website: https://egomemreason.github.io/
TTF: 时空融合用于高效的视频-语言模型
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出TTF方法,通过利用视频中的时间冗余性,减少视频语言模型的推理成本,保留高精度的同时显著降低视觉token数量。
Comments 14 pages; manuscript submitted to NeurIPS 2026
MedHorizon:迈向真实场景下的长上下文医学视频理解
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Baidu Inc.(百度公司) ; Xidian University(西安电子科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 MedHorizon提出一个真实场景下的长上下文医学视频理解基准,通过稀疏证据和多跳临床推理评估,揭示当前系统在完整流程理解上的不足。
StreamAgent:面向流视频理解的前瞻性代理
机构 * MBZUAI ; Shanghai AI Laboratory(上海人工智能实验室) ; DeepGlint ; Shanghai Jiao Tong University(上海交通大学) ; Monash University(墨尔本大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出StreamAgent,通过整合问题语义和历史观测,预测关键事件的时间进展,调整感知动作,提升流视频处理的响应准确性和实时效率。
PKS⁴:并行运动选择状态空间扫描器用于高效的视频理解
机构 * College of Computer Science, Sichuan University(四川大学计算机学院)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出PKS⁴,通过并行扫描器保留空间结构,以线性复杂度实现高效的视频理解,显著降低训练计算量。
MLLMs中分解注意力融合用于无训练视频推理分割
机构 * Yonsei University(延世大学) ; Inha University(inha大学) ; NAVER Cloud(NAVER云)
专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。
Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF
VIDEOP2R:从感知到推理的视频理解
机构 * USC(USC大学) ; Amazon(亚马逊) ; Keystone AI
专题命中 视频理解 :video understanding(title);video language model(abstract);video reasoning(abstract);分类 cs.CV
AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。
Comments CVPR Findings 2026
LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; Tongyi Group, Alibaba(阿里巴巴通义集团)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。
Comments 18 pages, 10 figures
逐步视频压缩与MLLM代理用于长视频理解
机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,杭州电子科技大学)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出ProVCA,通过逐步缩小范围从粗略片段到精细帧,利用MLLM进行高效视频理解,实现高准确率。
Comments Accepted to ICME 2026
流媒体视频理解的简单基线
机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV
AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。
Comments Project page: https://simple-stream.github.io/
Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。
Comments Updated first authors
CoPE-VideoLM:利用编解码器原语实现高效的视频语言建模
机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) ; Stanford University(斯坦福大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出CoPE-VideoLM,通过利用视频编解码器原语(如运动矢量和残差)减少计算开销,提升视频语言模型的效率和性能。
Comments Project Page: https://microsoft.github.io/CoPE