Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models
Flow-DPPO:用于流匹配模型的散度近端策略优化
机构 * Xi’an Jiaotong University(西安交通大学) ; Tencent Hunyuan(腾讯混元) ; National University of Singapore(新加坡国立大学)
AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。