From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao
机构
*
Duke University(杜克大学)
;
Adobe Inc.(奥多比公司)
;
Oregon State University(俄勒冈州立大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
National University of Singapore(新加坡国立大学)
;
Amazon(亚马逊)