Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network
通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别
机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ; ResoSight, Montreal, Canada(ResoSight公司)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)
AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。
Comments 15 pages, 4 figures