StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation
StructDiff:一种结构保持且空间可控的单图像生成扩散模型
机构 * Institute of Information Science, Beijing Jiaotong University(信息科学研究院,北京交通大学) ; Visual Intelligence +X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室,北京) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image editing(abstract);image synthesis(abstract)
AI总结 StructDiff基于单尺度扩散模型提出,通过自适应感受野模块和3D位置编码实现结构保持与空间可控,引入基于大语言模型的新型评估标准,优于现有方法在结构一致性、视觉质量和空间可控性上。
Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)