Forgetting: A New Mechanism Towards Better Large Language Model Fine-tuning
遗忘:一种改进大型语言模型微调的新机制
机构 * Department of Electrical and Computer Engineering, Isfahan University of Technology(伊斯法罕理工大学电气与计算机工程系) ; RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所先进智能项目中心) ; Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) ; School of Computer Science, Simon Fraser University(西蒙菲莎大学计算机科学学院) ; Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) ; Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系)
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.LG
AI总结 本文提出通过区分正负token来优化微调过程,通过遗忘不相关信息提升模型性能,实验表明该机制在多种基准上有效。
Journal ref Transactions on Machine Learning Research (TMLR), 03/2026