Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference
潜在记忆宫殿:作为自回归变分推理的控制推理
机构 * University of Washington(华盛顿大学) ; Toyota Research Institute(丰田研究院)
AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。