MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment
PIDNet: 逐步隐式解耦网络用于多模态动作质量评估
机构 * Qiushi Academy for Advanced Studies (QAAS), Zhejiang University(浙江大学启斯特先进研究院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Software Technology, Zhejiang University(浙江大学软件学院) ; State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) ; Collaborative Innovation Center for Artificial Intelligence by MOE and Zhejiang Provincial Government (ZJU)(教育部-浙江省人工智能协同创新中心) ; Zhejiang Lab(浙江实验室)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出PIDNet,通过逐步整合多模态信息与全局质量语义,提升多模态动作质量评估的准确性。采用iMambaWave模块和三阶段融合网络,有效解耦模态特定信息并增强特征表示。
Comments 14 pages, 6 figures, 11 tables