Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益
机构 * Sun Yat-Sen University(中山大学) ; ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) ; University of California, Merced(加州大学默塞德分校)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。
Comments 20 pages, 17 figures