Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos
用于流式航空视频中小目标理解的内存增强多模态大语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Freiburg(弗莱堡大学) ; Hangzhou City University(杭州城市大学) ; XGRIDS(XGRIDS公司) ; Fudan University(复旦大学) ; Hong Kong Baptist University(香港浸会大学)
AI总结 研究针对流式航空视频中小目标理解难题,提出像素级开放词汇数据集DroneEyes,以及含语义感知令牌路由器和分层内存库的多模态大语言模型SkyAnchor,从数据和方法角度应对挑战。