AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering
AdaptR1:基于强化学习的自适应交错思考在多跳问答中的应用
机构 * Computer Science, Fudan University(复旦大学计算机科学系) ; Institute of Modern Languages and Linguistics, Fudan University(复旦大学现代语言与语言学研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Soochow University(苏州大学)
专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 提出AdaptR1框架,通过强化学习动态分配每步推理预算,减少多跳问答中的过度思考,在保持性能的同时显著降低推理成本。