Multi-Modal Scene Graph with Kolmogorov-Arnold Experts for Audio-Visual Question Answering
多模态场景图与科莫戈罗夫-阿诺尔德专家网络用于音频-视觉问答
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出基于多模态场景图与科莫戈罗夫-阿诺尔德专家网络的SHRIKE模型,用于提升音频-视觉问答任务中的跨模态交互建模与时间推理性能。