StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
StateVLM: 一种用于机器人可操作推理的状态感知视觉语言模型
机构 * Department of Informatics, University of Hamburg(汉堡大学信息学院) ; King Abdullah University of Science and Technology(卡塔尔科学与技术大学)
专题命中 具身推理 :robotic(title,abstract);robotics(abstract);分类 cs.CV
AI总结 提出StateVLM模型,通过辅助回归损失训练策略增强视觉语言模型在目标检测和状态定位中的数值推理能力,并构建OSAR基准验证其有效性。