Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
学习构建环境:通过可验证环境合成实现自我进化推理RL
机构 * Tencent HY LLM(腾讯 HY LLM)
专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI
AI总结 本文提出通过可验证环境合成实现自我进化推理RL,构建环境而非生成数据,利用环境构造循环提升模型能力,通过稳定的问题-验证不对称性保持奖励信息性。
Comments Tech report, work in progress