Representation Forcing for Bottleneck-Free Unified Multimodal Models
表示强制:无瓶颈统一多模态模型
机构 * University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动种子) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Tsinghua University(清华大学)
AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。
Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing