Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL
AI总结 本文提出SCOPE框架,通过结合模型置信度和动态子组划分,解决测试时间强化学习中多数投票策略导致的确认偏误和稀疏奖励问题,提升大语言模型推理能力。
Comments Accepted to ACL 2025 Main Conference. 15 pages, 9 figures, 5 tables