Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization
通过约束策略优化实现推理大语言模型的自适应推理时间计算分配
机构 * Fudan University(复旦大学) ; ETH Zurich(苏黎世联邦理工学院) ; Guangming Lab(光明实验室)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(title,abstract);分类 cs.LG
AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。