Mosaic: Cross-Modal Clustering for Efficient Video Understanding
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。
Comments Accepted as a conference paper at CVPR 2026
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
STS-Mixer:用于4D点云视频理解的时空频混合器
机构 * Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University of Technology(浙江工业大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。
Comments Accepted by CVPR 2026, Open Sourced
OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进
机构 * ARC Lab, Tencent(腾讯ARC实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。
Comments Project Page: https://arcomniscript.github.io
Tango:驯服视觉信号以提高视频大语言模型的效率
机构 * University of Science and Technology of China(中国科学技术大学) ; Reconova AI Lab(Reconova AI实验室) ; Nanjing University(南京大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。
Comments Code: https://github.com/xjtupanda/Tango
ProPhy:渐进式物理对齐用于动态世界模拟
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Peng Cheng Laboratory(鹏城实验室) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; ETH Zürich(苏黎世联邦理工学院) ; Lenovo Research(联想研究院)
专题命中 视频理解 :video generation(abstract);分类 cs.CV
AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。