ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation
ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型
机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。