OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing
OmniOPSD:面向情感计算的理性特权在线自蒸馏
机构 * Shenzhen University(深圳大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Technology University(深圳技术大学) ; Tongji University(同济大学) ; Huawei(华为)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。