Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling
小规模RL控制器,大语言模型:基于RL引导的自适应采样用于测试时扩展
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Maryland College Park(马里兰大学学院市分校) ; Washington University in St. Louis(圣路易斯华盛顿大学)
AI总结 提出将自适应采样建模为马尔可夫决策过程,使用强化学习训练轻量级控制器,在答案正确性、延迟和计算成本之间取得平衡。