From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models
从片段到场景:自动驾驶中基于视觉语言模型的时间理解
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; University of Southern California(南加州大学)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。