Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions
超越标量奖励:将推理内化到分数分布中
机构 * Alibaba Group(阿里巴巴集团) ; Nankai University(南开大学)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。
Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/