Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment
用于动作质量评估的具有自适应对齐的两阶段多模态融合
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) ; Zhongguancun Laboratory(中关村实验室)
专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);分类 cs.CV
AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。
Comments Accepted to IJCV