From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao
机构
*
Duke University(杜克大学)
;
Adobe Inc.(奥多比公司)
;
Oregon State University(俄勒冈州立大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
National University of Singapore(新加坡国立大学)
;
Amazon(亚马逊)
机构
*
Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院土木与环境工程系)
Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective
重新思考异构语言模型合并:加权模型平均视角
Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian
机构
*
University of Science and Technology of China(中国科学技术大学)
;
School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Great Bay University(大湾区大学)