SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation
SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作
机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。
Comments 7 pages, 2 figures