Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning
利用离线质量多样性强化学习学习分层技能策略
机构 * The University of Tokyo(东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
AI总结 该研究提出QDOS算法,通过优势加权质量多样性预训练与双数据集复用策略,在分层技能学习框架下,于稀疏奖励任务中显著提升性能,优于强基线算法。
Comments IROS 2026