X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment
X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中
机构 * Tencent Hunyuan(腾讯混元) ; Zhejiang University(浙江大学)
AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。