WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
WCM:用于视觉-语言-动作强化学习的世界评论者模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。