Hard Negative Sample-Augmented DPO Post-Training for Small Language Models
增强的DPO后训练用于小型语言模型
机构 * Computer Science NYU Shanghai(纽约大学上海学院)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);small language model(title);LLM(abstract,abstract_cn)
AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。