Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning
视觉语言动作模型所言即所指?论忠实性在具身推理中的作用
机构 * Stanford University(斯坦福大学) ; Politecnico di Milano(米兰理工大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所) ; NVIDIA Research(英伟达研究院)
专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 研究视觉语言动作模型中具身思维链是否真实反映决策过程。区分功能推理与忠实推理,指出当前对齐策略不足,通过人类评估揭示差距,用学习的评论家操作具身忠实性的行为替代物,强化学习后训练策略提升了忠实性。