Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling
超越基于VLM的奖励:扩散原生潜在奖励建模
机构 * The Hong Kong University of Science ; Huawei Hong Kong AI Framework \& Data Technologies Lab ; Tsinghua University ; The Australian National University
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。
Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm