VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection
VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合
机构 * Arizona State University(亚利桑那州立大学) ; Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) ; U.S. Department of Defense(美国国防部) ; United States Military Academy(美国军事学院) ; Syracuse University(雪城大学)
专题命中 多传感器融合 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.CV
AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。
Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award