SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
基于场景图的多模态交通代理:视频理解的模块化框架
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。