Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis
增强多模态大语言模型以用于安全关键驾驶视频分析
机构 * Verizon Connect
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本研究通过融合降采样视频帧与同步高频 telemetry 数据及专用计算机视觉模型的语义信息,提升多模态大语言模型在安全关键驾驶场景中的感知与推理能力,从而更准确地识别和描述现实驾驶中的安全关键事件。
Comments Accepted at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)