Can Vision-Language Models Reason about AI Edits in Images?
视觉-语言模型能否对图像中的AI编辑进行推理?
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM Research(IBM研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。