TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation
TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器
机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 扩散模型 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV
AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。
Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables