DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
DriveXQA: 多模态视觉问答用于恶劣驾驶场景理解
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学) ; Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)
专题命中 视觉问答 :visual question answering(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出DriveXQA多模态数据集,用于自主驾驶场景中的视觉问答,通过融合多传感器信息提升对异常驾驶场景的理解能力。
Comments Accepted to CVPR DriveX Workshop. Dataset and Code: https://github.com/jtjmd/DRIVEXQA