Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation
眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成
机构 * Peking University(北京大学) ; Tencent(腾讯) ; Dalian University of Technology(大连理工大学) ; Nanyang Technological University(南洋理工大学) ; University of Cambridge(剑桥大学) ; Zhejiang University(浙江大学)
专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV
AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。