Mosaic: Cross-Modal Clustering for Efficient Video Understanding
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频多模态 :cross-modal(title,abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频多模态 :cross-modal(title,abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM
机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) ; WeChat AI, Tencent(腾讯微信人工智能)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。
ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) ; National University of Defense Technology(国防科技大学)
专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI
AI总结 本文提出ForestPrune,一种无需训练的视频MLLM令牌压缩方法,通过时空森林建模实现高效高比率压缩,实验表明其在视频任务中效果优于现有方法。
HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。
Comments Accepted as a conference paper at CVPR 2026
rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。
Comments Accepted by CVPR 2026
4D-RGPT:通过感知蒸馏实现区域级4D理解
机构 * NVIDIA(英伟达)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。
Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
STORM:视频中的端到端提及多目标跟踪
机构 * Amazon(亚马逊)
专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI
AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。
Comments CVPR 2026 Findings
DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化
机构 * Tongji University(同济大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.MM
AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。
Comments 13 pages, 6 figures
TAG-Head:时间对齐图头用于即插即用的细粒度动作识别
机构 * Edge Hill University(埃奇希尔大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出TAG-Head,一种轻量级时空图头,通过RGB单一模态提升细粒度动作识别性能,采用Transformer编码器和图结构增强时空依赖性,实验证明其在RGB-only模型中达到SOTA,优于多模态方法。
Comments 15 pages, 3 figures, to appear in ICPR 2026
ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。
Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/
Tango:驯服视觉信号以提高视频大语言模型的效率
机构 * University of Science and Technology of China(中国科学技术大学) ; Reconova AI Lab(Reconova AI实验室) ; Nanjing University(南京大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。
Comments Code: https://github.com/xjtupanda/Tango
从视频基础模型推断动态物理性质
机构 * VGG, University of Oxford(牛津大学VGG实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。
对抗性视频推广对抗文本到视频检索
机构 * Xi'an Jiaotong University(西安交通大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。
Comments This paper has been accepted by TIFS
可解释的人体活动识别:概念和机制的统一综述
机构 * University of South Florida(南佛罗里达大学) ; California Polytechnic State University(加州州立理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文综述了可解释人体活动识别方法,从概念和机制角度分析其复杂性,总结了主要挑战和未来方向。
MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding
机构 * University of Maryland(马里兰大学) ; Dolby Laboratories(杜比实验室) ; University of Southern California(南加州大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。
基于立体事件和强度相机的立体事件运动去模糊网络
机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出St-EDNet网络,通过粗到细框架直接从错位输入恢复高质量图像,利用立体事件和强度相机数据,无需真实深度,构建双特征嵌入架构以重建潜在锐化图像序列。
面向资源受限平台的生成式AI推理性能的技术解决方案
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文针对生成式AI推理在资源受限平台上的内存压力问题,提出两种技术方案,通过分层屋顶线分析模型评估其在容量和带宽上的性能影响。
TESSERA:表面光谱的时间嵌入用于地球表示与分析
机构 * University of Cambridge(剑桥大学) ; dClimate Labs(dClimate实验室) ; Aalto University(阿尔托大学) ; University of Bristol(布里斯托大学)
专题命中 视频多模态 :multi-modal(abstract)
AI总结 TESSERA通过多模态遥感时间序列学习鲁棒嵌入,提升植被物候分析的准确性与效率,提供轻量级工具支持大规模地球观测任务。