Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning
LLM上的模块化强化学习:从MDP创建到探索与学习
Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet
机构
*
VU Amsterdam(阿姆斯特丹自由大学)
;
University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
;
Leiden University(莱顿大学)
;
University of Warsaw(华沙大学)
;
Simon Fraser University(西蒙菲莎大学)
;
The University of Hong Kong(香港大学)
机构
*
School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
;
NiuTrans Research(NiuTrans研究院)
;
Institute of Psychology, CAS(中国科学院心理研究所)
;
Kunming University of Science and Technology(昆明理工大学)
Staleness-Learning Rate Scaling Laws for Asynchronous RLHF
异步RLHF的陈旧度-学习率缩放定律
Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi
机构
*
The University of Hong Kong(香港大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Gradient
;
University of Southern California(南加州大学)
;
The Hong Kong Polytechnic University(香港理工大学)
机构
*
University of Georgia(佐治亚大学)
;
Tencent AI Lab(腾讯AI实验室)
;
The Education University of Hong Kong(香港教育大学)
;
The Hong Kong Polytechnic University(香港理工大学)
专题命中
后训练与偏好优化
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组)
;
Stanford University(斯坦福大学)
;
Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)
Hey Chat, Can You Teach Me? Structuring Socratic Dialogue for Human Learning in the Wild
嘿,聊天机器人,你能教我吗?为人类学习构建结构化苏格拉底式对话
Sidney Tio, Arunesh Sinha, Pradeep Varakantham
机构
*
School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)
;
Department of Management Science and Information Systems, Rutgers Business School(罗格斯大学商学院管理科学与信息系统系)
专题命中
后训练与偏好优化
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI