Test-Time Verification for Text-to-SQL via Outcome Reward Models
基于结果奖励模型的文本到SQL测试时验证
机构 * Polytechnic University of Bari(巴里理工大学) ; IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。
Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US