From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
机构 * Duke University(杜克大学) ; Adobe Inc.(奥多比公司) ; Oregon State University(俄勒冈州立大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。
Comments COLM 2026