Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback
位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位
机构 * Tsinghua University(清华大学) ; Kolors Team, Kuaishou Technology(快手科技Kolors团队) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; South China Normal University(华南师范大学)
专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV
AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。
Comments 25 pages, 9 figures