Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization
稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化
机构 * OPPO AI Center(OPPO AI中心)
AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。
大厂专区
稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化
机构 * OPPO AI Center(OPPO AI中心)
AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。