SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
SceneGraphVLM:基于视频的动态场景图生成方法
机构 * MIRAI
专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract,abstract_cn);visual language model(abstract);分类 cs.CV
AI总结 SceneGraphVLM通过紧凑的视觉语言模型生成视频场景图,采用TOON格式提升效率,结合监督微调与强化学习实现高精度与速度的平衡,适用于PSG、PVSG和Action Genome数据集。