UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
UniVL:统一的视觉-语言嵌入用于空间接地的上下文图像生成
机构 * Center for Advanced AI(先进人工智能中心)
专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种统一的视觉-语言嵌入方法,通过单一的视觉输入直接将语义绑定到空间位置,从而减少计算并提高图像生成质量。