Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization
为何您的分词器在信息融合中失败:一种面向时间的预量化融合用于视频增强的音频分词
机构 * School of Electrical Engineering and Telecommunications, University of New South Wales(新南威尔士大学电气工程与电信学院) ; Dolby Laboratories(杜比实验室)
专题命中 融合架构与评测 :information fusion(title);multimodal fusion(abstract)
AI总结 本文研究了视频增强音频分词中重建质量下降的根本原因,提出了一种面向时间的预量化融合方法,通过在分词器架构中合理定位融合位置,结合时间轴上的特征融合,实现了高保真重建和下游任务的优越性能。