Text-to-Image Models Need Less from Text Encoders Than You Think
文生图模型对文本编码器的依赖比你想象的要少
机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文发现基于扩散Transformer的文生图模型主要依赖文本编码器提供的单词含义和词序信息,而非完整的上下文信息,并通过构建仅含位置标记词袋的嵌入验证了这一观点。
Comments Project webpage: https://nsping13.github.io/contextless-TTI/