Asymmetric Hierarchical Anchoring for Robust Audio-Visual Cross-Modal Generalization
非对称层次锚定用于音频-视觉联合表示:解决信息分配模糊性以实现鲁棒跨模态泛化
机构 * Zhejiang University, China(浙江大学) ; University of California, Berkeley, USA(加州大学伯克利分校) ; MMLab, Chinese University of Hong Kong, China(香港中文大学MMLab)
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract)
AI总结 本文提出非对称层次锚定框架,通过结构化语义锚点解决跨模态泛化中的信息分配模糊性,提升语义一致性和表示纯度。