Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models
基于熵-KL散度的令牌掩码:一种用于大语言模型选择性微调的新方法
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Cloud(华为云)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 针对低数据场景下标准监督微调导致模型分布偏移的问题,提出EKSFT方法,通过选择性掩码高熵或高KL散度的令牌,在注入任务知识的同时保持预训练分布完整性,在数学推理基准上优于标准SFT并提升后续RL性能。
Comments 17 pages