CODE-SHARP: Continuous Open-ended Discovery and Evolution of Skills as Hierarchical Reward Programs
CODE-SHARP: 连续开放发现和演化的技能作为层次奖励程序
机构 * Imperial College London(帝国理工学院伦敦分校) ; Sony Interactive Entertainment(索尼互动娱乐)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出CODE-SHARP框架,通过基础模型自主发现和演化技能作为层次奖励程序,实现通用智能体政策的从零开始强化学习,无需预定义奖励,有效学习长周期技能。
Comments Preprint