Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
联合奖励建模:将思维链内化以实现高效的视觉奖励模型
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Kuaishou Technology(快手科技)
AI总结 提出联合奖励建模(JRM),通过共享视觉-语言骨干联合优化偏好学习和语言建模,将生成模型的语义推理能力内化到判别表示中,实现快速准确评估,在MMRB2和EditReward-Bench上取得最优结果。