Mosaic: Cross-Modal Clustering for Efficient Video Understanding
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
Mosaic:用于高效视频理解的跨模态聚类
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract)
AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。
HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解
机构 * Sun Yat-Sen University(中山大学) ; Alibaba Group(阿里巴巴集团) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。
Comments Accepted as a conference paper at CVPR 2026
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
STS-Mixer:用于4D点云视频理解的时空频混合器
机构 * Nanyang Technological University(南洋理工大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University of Technology(浙江工业大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。
Comments Accepted by CVPR 2026, Open Sourced
OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进
机构 * ARC Lab, Tencent(腾讯ARC实验室)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。
Comments Project Page: https://arcomniscript.github.io
Tango:驯服视觉信号以提高视频大语言模型的效率
机构 * University of Science and Technology of China(中国科学技术大学) ; Reconova AI Lab(Reconova AI实验室) ; Nanjing University(南京大学)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。
Comments Code: https://github.com/xjtupanda/Tango
ProPhy:渐进式物理对齐用于动态世界模拟
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Peng Cheng Laboratory(鹏城实验室) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; ETH Zürich(苏黎世联邦理工学院) ; Lenovo Research(联想研究院)
专题命中 视频理解 :video generation(abstract);分类 cs.CV
AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。
提示中继:多事件视频生成的推理时时间控制
机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。
通过潜变量对齐与对数编码实现HDR视频生成
机构 * Lightricks ; Gear Productions ; Tel Aviv University(特拉维夫大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出通过利用预训练生成模型的视觉先验,采用对数编码实现HDR视频生成,无需重新训练编码器,通过轻量微调即可实现高质量HDR视频生成。
Comments https://HDR-LumiVid.github.io
对抗性视频推广对抗文本到视频检索
机构 * Xi'an Jiaotong University(西安交通大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。
Comments This paper has been accepted by TIFS
基于LLM的现实安全关键驾驶视频生成
机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) ; Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
专题命中 视频生成 :video generation(title,abstract)
AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。
Immune2V: 图像免疫对抗双流图像到视频生成
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对图像到视频生成中对抗性攻击的鲁棒性问题,提出Immune2V框架,通过时间平衡的潜在差异和预计算的崩溃诱导轨迹提升防御效果。
LottieGPT:为自回归生成设计向量动画的标记化
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; AIR, Tsinghua University(清华大学人工智能研究院) ; BAAI(百度人工智能研究院) ; The Hong Kong Polytechnic University(香港理工大学) ; Nanjing University(南京大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。
Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/
AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频
机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) ; The University of Sydney(悉尼大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。
超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK(科大讯飞)
专题命中 视频生成 :video generation(abstract)
AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。
任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示
机构 * Westlake University(西湖大学) ; Afari Intelligent Drive(阿法里智能驾驶) ; Zhejiang University(浙江大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。
Comments Under Review. Project Page: https://wswdx.github.io/3DRAE
AIM: 基于意图的统一世界动作建模与空间价值图
机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 动作与事件理解 :video generation(abstract)
AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。
INSPATIO-WORLD:通过时空自回归建模实现实时4D世界模拟器
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 本文提出INSPATIO-WORLD框架,通过时空自回归模型实现从单帧视频恢复和生成高保真动态交互场景,解决空间一致性和实时交互难题,实现在WorldScore-Dynamic基准中领先。
矩阵游戏3.0:具有长时程记忆的实时和流式交互世界模型
机构 * Skywork AI(天工AI)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 矩阵游戏3.0通过改进数据、模型和推理方法,实现了720p实时长视频生成,支持长时程时空一致性,提升了生成效率和质量。
Comments Project page: https://matrix-game-v3.github.io/
Eevee:迈向基于视频的高分辨率虚拟试衣
机构 * Amap, Alibaba Group(高德,阿里巴巴集团) ; Tianjin University(天津大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出高分辨率视频虚拟试衣数据集,解决现有方法在真实纹理细节捕捉和近距离视频生成上的不足,引入VGID指标评估服装一致性,提升虚拟试衣的真实感和细节保真度。
VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估
机构 * Ant Group(蚂蚁集团) ; Beijing Film Academy(北京电影学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)
专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV
AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。
Comments CVPR 2026
多模态语言模型中的人口和语言偏差评估
机构 * Freie Universität Berlin(柏林自由大学)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 本文评估了多模态语言模型中的人口和语言偏差,通过不同任务揭示图像和视频理解任务在人口差异上表现更优,而音频理解任务存在显著偏差和预测崩溃。
Comments Accepted at ICPR 2026. Full paper with complete appendix (31 pages total)