Cinematic Audio Source Separation Using Visual Cues
电影音频源分离使用视觉线索
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院) ; Graduate School of Artificial Intelligence, UNIST(蔚山科学技术院人工智能研究生院)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
AI总结 本文提出首个结合视觉信息的电影音频源分离框架AV-CASS,通过条件流匹配实现多模态音频分离,并设计专用视觉编码器提升分离质量。
Comments CVPR 2026. Project page: https://cass-flowmatching.github.io