STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision
STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计
机构 * University of Michigan(密歇根大学)
专题命中 多传感器融合 :LiDAR(abstract,abstract_cn);autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。