IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder
IDEAL: 深度对齐实现离散表示自编码器
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) ; Shanghai Innovation Institute(上海创新研究院) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。
Comments Code is available at https://github.com/Row11n/IDEAL