ISO: An RLVR-Native Optimization Stack
ISO:一种原生 RLVR 的优化栈
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UIUC(伊利诺伊大学香槟分校) ; Emory University(埃默里大学) ; Together AI(联合人工智能公司) ; Recursive Superintelligence Inc(递归超级智能公司) ; ELLIS Institute Tübingen(图宾根埃利斯研究所)
AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。
Comments Preprint