arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-23 至 2026-04-23 共收录 1
2604.19766 2026-04-23 cs.CL cs.AI

OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models

OThink-SRR1: 通过强化学习增强大语言模型的搜索、细化与推理

Haijian Liang, Zenghao Niu, Junjie Wu, Changwang Zhang, Wangchunshu Zhou, Jun Wang

机构 * Shenzhen University(深圳大学) OPPO Research Institute(OPPO研究院)

AI总结 OThink-SRR1通过强化学习训练的迭代搜索-细化-推理流程,有效解决复杂多跳问题中的检索噪声干扰和计算成本问题,实验表明其在多跳问答基准上准确率优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏