PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。