arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-12 至 2026-05-12 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 11 篇

2605.08158 2026-05-12 cs.CV cs.AI 88%

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title);video-language(abstract);分类 cs.CV

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07575 2026-05-12 cs.CV cs.AI 79%

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 74%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09158 2026-05-12 cs.CV 74%

FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO

FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解

Fufangchen Zhao, Songbai Tan, Xuerui Qiu, Linrui Xun, Wenhao Jiang, Jinkai Zheng, Hehe Fan, Jian Gao, Danfeng Yan, Ming Li

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Central South University(中南大学) Zhejiang University(浙江大学) College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI 70%

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23617 2026-05-12 cs.CV cs.AI cs.GR cs.LG 70%

One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory

一条轨迹,一个标记:通过全景子对象轨迹实现的 grounded 视频标记化

Chenhao Zheng, Jieyu Zhang, Mohammadreza Salehi, Ziqi Gao, Vishnu Iyengar, Norimasa Kobori, Quan Kong, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能艾伦研究所) Woven by Toyota, Inc(丰田公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出 grounded 视频标记化方法,通过全景子对象轨迹组织标记,减少冗余并保持时间一致性,TrajViT 在多个视频理解基准上优于空间-时间 ViT,具有更高的效率和性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03276 2026-05-12 cs.CV 70%

VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing

VEBench: 多模态大模型在真实世界视频编辑中的基准测试

Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) CRCV, University of Central Florida(中央佛罗里达大学CRCV)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 VEBench通过高质量视频和人工验证问题对多模态大模型在视频编辑中的知识理解和操作推理能力进行评估,揭示当前模型与人类水平间的显著差距。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10050 2026-05-12 cs.CV 57%

EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs

EchoPrune: 将冗余视为时间回声以实现高效的视频大语言模型

Jiameng Li, Minye Wu, Jiezhang Cao, Aleksei Tiulpin, Matthew B. Blaschko

机构 * KU Leuven(鲁文大学) Shanghai Jiaotong University(上海交通大学) Weill Cornell Medicine(韦尔医学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EchoPrune方法,通过将冗余视频token视为时间回声,提升视频大语言模型在固定token预算下的时间分辨率,实验表明其在六个视频理解基准上使模型处理20倍帧数,性能提升8.6%且推理速度提升5.6倍。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09507 2026-05-12 cs.CV 57%

Uncertainty-Aware and Decoder-Aligned Learning for Video Summarization

面向视频摘要的不确定性感知与解码器对齐学习

Omer Tariq, Syed Muhammad Raza, Jeongbae Son

机构 * Perception AI Neubility Inc.(感知AI Neubility公司)

专题命中 视频理解 :long video(abstract);分类 cs.CV

AI总结 本文提出VASTSum框架,通过建模不确定性并使学习目标与解码阶段对齐,提升视频摘要的鲁棒性与效率。

Comments Accepted for presentation at the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV 57%

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV 57%

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏