TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment
TMPO:用于多样化和高效扩散对齐的轨迹匹配策略优化
机构 * Huazhong University of Science and Technology(华中科技大学) ; Kuaishou Technology(快手科技) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
AI总结 本文提出TMPO,通过轨迹级奖励分布匹配提升扩散模型生成多样性,采用Softmax-TB目标和动态随机树采样,有效减少训练时间并提升性能。