Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation
打破锁定:通过表示调制实现文本到图像生成的多样化
机构 * KAIST(韩国科学技术院)
AI总结 针对文本到图像模型在固定提示下生成样本过于相似的问题,提出无训练表示级干预方法DAVE,通过选择性衰减早期生成中的零频空间平均分量来增强多样性,保持图像质量且计算开销极小。
Comments Accepted to ICML 2026. Code is available at: https://github.com/daheekwon/DAVE