LightAVSeg: Lightweight Audio-Visual Segmentation
LightAVSeg: 轻量级音频视觉分割
机构 * College of Informatics, Huazhong Agricultural University, Wuhan, China(华中农业大学信息学院) ; School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) ; School of Computer Science, Adelaide University, Australia(阿德莱德大学计算机科学学院) ; School of Engineering, University of Warwick, Coventry, UK(沃里克大学工程学院) ; Zhejiang Yuexiu University, Shaoxing, China(浙江越秀大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出LightAVSeg,通过解耦设计替代重注意力机制,实现线性交互成本,提升效率,实验显示其在MS3基准上达到50.4 mIoU,参数量仅为AVSegFormer的1/7。
Comments 15 pages, 8 figures, 6 tables, Accepted to ICML 2026