M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production
M3T:用于手语生成的离散多模态运动令牌
机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出M3T,一种基于多模态运动词汇的自回归Transformer,通过结合FLAME的丰富表情空间与SMPL-X身体模型,实现手语生成中手、脸和口部动作的高质量表达。