Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
过重采样优化:大语言模型推理的测试时自校正
机构 * University of Oklahoma(俄克拉荷马大学) ; Stanford University(斯坦福大学) ; Universitat Pompeu Fabra(庞培法布拉大学) ; Air University(空军大学)
专题命中 测试时计算 :reasoning(title,abstract);self-correction(title,abstract);test-time compute(abstract);verifier(abstract)
AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。
Comments Submitted to EMNLP 2026