LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解
机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Peking University(北京大学) ; HKUST(香港科技大学) ; CASIA(中国科学院自动化研究所) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);multimodal(abstract);cross-modal(abstract)
AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。
Comments 21 pages, 15 figures