arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-20 至 2026-05-20 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 1 篇

2605.19322 2026-05-20 cs.CV 77%

DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs

DynaTok: 时序自适应和位置偏见感知的视频大语言模型token压缩

Minyoung Park, Taehun Kong, Sangjun Ahn

机构 * LG Electronics, Seoul, South Korea(LG电子,首尔,韩国)

专题命中 长视频与时序推理 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出DynaTok,一种无需训练的时序自适应和位置偏见感知的token压缩框架,通过在时序和空间维度上分配token预算,有效减少冗余的时空覆盖,提升视频大语言模型的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏