Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models
超越成对偏好:扩散模型的列表级奖励感知对齐
机构 * Caltech(加州理工学院) ; Stanford University(斯坦福大学)
AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。
高校专区
超越成对偏好:扩散模型的列表级奖励感知对齐
机构 * Caltech(加州理工学院) ; Stanford University(斯坦福大学)
AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。