ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
ReSkill:在智能体强化学习中协调技能创建与策略优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。