Listener-Rewarded Thinking in VLMs for Image Preferences
图像偏好中的VLMs思考奖励
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。
Comments part of a different work
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
图像偏好中的VLMs思考奖励
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。
Comments part of a different work