Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models
通过视觉语言模型从自我中心视觉解码行人过街意图
机构 * Technical University of Denmark(丹麦技术大学) ; University of Helsinki(赫尔辛基大学) ; Delft University of Technology(代尔夫特理工大学)
专题命中 视觉问答 :vision language model(title,abstract);VLM(summary_cn,abstract_cn);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 利用视觉语言模型(VLM)将行人过街意图预测转化为视觉问答任务,通过参数高效微调并结合自我运动、车辆运动和眼动等上下文线索,在自我中心视频上实现了14.5%的准确率提升,创下新纪录。