Inference Time Policy Optimization for Offline RL with Differentiable World Models
基于可微世界模型的离线强化学习推理时间策略优化
Rohan Deb, Stephen J. Wright, Arindam Banerjee
机构
*
Siebel School of Computing and Data Science(计算与数据科学学院)
;
Department of Computer Sciences(计算机科学系)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Wisconsin Madison(威斯康星大学麦迪逊分校)
Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards
用于密集奖励的领域可适应强化学习代码生成
Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini
机构
*
Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心)
;
National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
TimeRewarder: 通过帧间时间距离从被动视频中学习密集奖励
Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao
机构
*
Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院)
;
Shanghai Qi Zhi Institute(上海启智研究院)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Pennsylvania(宾夕法尼亚大学)
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
School of Integrated Circuits, Peking University(北京大学集成电路学院)
;
School of Information, Huazhong Agricultural University(华中农业大学信息学院)
;
Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学先进技术网络研究院)
机构
*
The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州))
;
National University of Singapore(新加坡国立大学)
;
ShanghaiTech University(上海科技大学)
;
East China Normal University(华东师范大学)
;
Nanjing University of Information Science & Technology(南京信息工程大学)
;
Zhejiang University(浙江大学)
;
Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
Reinforcement Learning for Risk Adaptation via Differentiable CVaR Barrier Functions
通过可微分CVaR障碍函数实现风险适应的强化学习
Xinyi Wang, Taekyung Kim, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou
机构
*
Department of Robotics(机器人学系)
;
Department of Aerospace Engineering(航空航天工程系)
;
University of Michigan(密歇根大学)
;
Toyota Motor North America, Research & Development(丰田美国北美洲研发)
Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning
基于潜在类比的组合转导用于离线目标条件强化学习
Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh
机构
*
Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI)
;
Independent researcher(独立研究者)
;
Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)