GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs
GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Great Bay University(大湾区大学) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)
专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);分类 cs.CV
AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。
Comments Accepted to ACM MM 2026