ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展
机构 * ETH Zürich(苏黎世联邦理工学院) ; National University of Singapore(新加坡国立大学) ; MBZUAI(马斯喀特人工智能研究所) ; University of Zürich(苏黎世大学) ; The University of Melbourne(墨尔本大学)
专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。
Comments ACL 2026 Main