Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策
机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) ; Princeton University(普林斯顿大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。