Chain-of-Goals Hierarchical Policy for Long-Horizon Offline Goal-Conditioned RL
Chain-of-Goals 分层策略用于长视界离线目标条件强化学习
Jinwoo Choi, Sang-Hyun Lee, Seung-Woo Seo
机构
*
Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(首尔国立大学电气与计算机工程系)
;
Department of Automotive Engineering, Ajou University, Gyeonggi-do, South Korea(全州大学汽车工程系)
机构
*
School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院)
;
Zhongguancun Academy, Beijing, China(中关村学院)
;
School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院)
;
School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)
;
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)
机构
*
TU Darmstadt(达姆施塔特工业大学)
;
Honda Research Institute Europe(本田欧洲研究所)
;
Columbia University(哥伦比亚大学)
;
Tongji University(同济大学)
;
Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)
;
University of Würzburg(维尔茨堡大学)
;
Hessian.AI(黑森人工智能中心)
Shaping Sparse Rewards in Reinforcement Learning: A Semi-supervised Approach
在强化学习中塑造稀疏奖励:一种半监督方法
Wenyun Li, Wenjie Huang, Chen Sun
机构
*
Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系)
;
Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系)
;
Musketeers Foundation Institute of Data Science, HKU(穆斯克特基金会数据科学研究所)
Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
The University of Hong Kong(香港大学)
;
INFIFORCE Intelligent Technology(INFIFORCE智能技术)
;
Princeton University(普林斯顿大学)
机构
*
School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学)
;
Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校)
;
The University of Hong Kong(香港大学)