Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
无需真实解即可改进大语言模型的强化学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Snowflake AI Research
AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。
大厂专区
无需真实解即可改进大语言模型的强化学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Snowflake AI Research
AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。