Learning from Saturated Data: Signals Beyond Correctness for LLM Training
从饱和数据中学习:LLM训练中超越正确性的信号
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文研究在基准测试和训练数据集饱和的情况下,如何利用超越二元正确性的细粒度质量信号(如成对LLM自判断和token级熵)来提升下游性能,实验表明在简单算术任务上质量信号显著优于SFT,但在复杂任务上效果有限且需谨慎校准。
Comments 25 pages, 5 figures