Strategic Scaling of Test-Time Compute: A Bandit Learning Approach
测试时计算的战略扩展:一种多臂学习方法
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。
Comments To appear at ICLR 2026