Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization
教方法而非答案:用于多模态策略优化的特权辅导蒸馏
机构 * Tianjin University(天津大学) ; Beijing Institute of Technology(北京理工大学) ; Singapore Management University(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaomi Inc(小米公司)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。