DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models
DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。
Comments project page: https://sleepy1231.github.io/DreOPD/