Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
提升多模态语言模型:带有视觉偏见评估的分阶段训练
机构 * StepFun-Audio Team(StepFun-Audio团队)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.AI
AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。
Comments Project page: https://cheliu-computation.github.io/omni/