Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering
Q-TriM:用于视听问答的问题引导三模态注意力
机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。
Comments Accepted at ECCV 2026