SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing
SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Beijing Wuzi University(北京物资学院)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。
Comments Accepted by WAICA 2026