arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-30 至 2026-04-30 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2505.24867 2026-04-30 cs.CV cs.AI 79%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 长视频与时序推理 :video-language(title);video understanding(abstract);分类 cs.CV

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05959 2026-04-30 cs.CV 57%

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT:O(1)常数成本流式视觉几何变换器

Si-Yu Lu, Po-Ting Chen, Hui-Che Hsu, Sin-Ye Jhong, Wen-Huang Cheng, Yung-Yao Chen

机构 * National Taiwan University(国立台湾大学) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 OVGGT通过自选择缓存和动态锚点保护,在固定内存预算下实现长视频流式处理,取得最佳3D几何精度。

Comments Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏