OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
OPPO: 用于LLM推理中令牌级信用分配的贝叶斯价值递归
机构 * George Washington University(乔治华盛顿大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出OPPO方法,通过贝叶斯更新累积轨迹级成功概率,实现无需价值网络的令牌级优势估计,在数学、科学和代码推理基准上优于GRPO、DAPO和SDPO。