arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

California Institute of Technology(加州理工学院)

2026-05-27 至 2026-05-27 共收录 1
2605.26491 2026-05-27 cs.LG cs.CV

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

超越成对偏好:扩散模型的列表级奖励感知对齐

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

机构 * Caltech(加州理工学院) Stanford University(斯坦福大学)

AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。

详情

展开后加载摘要…

URL PDF HTML 收藏