EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
EmbodimentSemantic:面向具身操作轨迹的空间场景图数据集与视觉语言模型基准
机构 * Politecnico di Torino(都灵理工大学) ; University College London(伦敦大学学院)
专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO
AI总结 提出EmbodimentSemantic数据集与基准,通过场景图三元组评估VLM在具身操作中的空间关系理解,发现现有模型在深度感知和视角依赖关系上存在不足。