Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning
Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏
机构 * Xi’an Jiaotong University(西安交通大学) ; MOE KLINNS Lab(MOE KLINNS实验室) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) ; Sun Yat-sen University(中山大学)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。