$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data
$S^3$-R1: 通过合成数据学习逐步检索与回答
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Google DeepMind(谷歌DeepMind)
AI总结 提出S^3-R1框架,通过合成数据生成和密集奖励信号,解决强化学习后训练中稀疏奖励和缺乏多跳问题数据的问题,提升模型搜索与问答能力。
Comments Under Review