SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models
SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法
机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) ; Fudan University, Shanghai, China(复旦大学) ; Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。
Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies