EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
EmbodimentSemantic:面向具身操作轨迹的空间场景图数据集与视觉语言模型基准
机构 * Politecnico di Torino(都灵理工大学) ; University College London(伦敦大学学院)
专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO
AI总结 提出EmbodimentSemantic数据集与基准,通过场景图三元组评估VLM在具身操作中的空间关系理解,发现现有模型在深度感知和视角依赖关系上存在不足。