RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
RE-VLM:事件增强的视觉-语言模型用于场景理解
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 视觉问答 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出RE-VLM,一种结合RGB图像和事件流的双流视觉-语言模型,旨在提升在正常和恶劣条件下对场景的理解能力。通过事件相机提供的高时间分辨率和宽动态范围的数据,RE-VLM在场景描述和视觉问答任务中优于现有模型。
Comments 10 pages, 6 figures, 6 tables