OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models
OThink-SRR1: 通过强化学习增强大语言模型的搜索、细化与推理
机构 * Shenzhen University(深圳大学) ; OPPO Research Institute(OPPO研究院)
AI总结 OThink-SRR1通过强化学习训练的迭代搜索-细化-推理流程,有效解决复杂多跳问题中的检索噪声干扰和计算成本问题,实验表明其在多跳问答基准上准确率优于现有方法。