Can Text-to-Image Models Draw from the Right Frame of Reference?
文本到图像模型能否从正确的参考框架中生成图像?
专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV
AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。
Comments 9 pages, 3 figures