Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
提升多模态语言模型:带有视觉偏见评估的分阶段训练
机构 * StepFun-Audio Team(StepFun-Audio团队)
专题命中 多模态评测 :omni-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。
Comments Project page: https://cheliu-computation.github.io/omni/