CLEAR: Null-Space Projection for Cross-Modal De-Redundancy in Multimodal Recommendation
CLEAR: 多模态去冗余中的跨模态空域投影
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 CLEAR通过显式减少跨模态冗余提升多模态推荐性能,采用子空间投影方法增强表示学习动态。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
CLEAR: 多模态去冗余中的跨模态空域投影
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 CLEAR通过显式减少跨模态冗余提升多模态推荐性能,采用子空间投影方法增强表示学习动态。
端到端的同时口吃语音重建与帧级适配模块及多视图知识蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; iFlytek Co., Ltd.(科大讯飞股份有限公司)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
AI总结 本文提出端到端的同时口吃语音重建系统,通过帧级适配模块和多视图知识蒸馏模块,提升重建语音的鲁棒性和可懂度。
Comments Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)
Journal ref 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), Singapore, 2025, pp. 1092-1097
为统一多模态语音识别适应语音基础模型与大语言模型
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出UASR-LLM框架,通过大语言模型与语音基础模型结合,实现多模态语音识别的统一优化与性能提升。
Comments 10 pages, 4 figures, 5 tables