Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention
具有语言信息的多模态融合用于越南语场景文本图像描述:数据集、图框架和语音注意力
机构 * Faculty of Information Science and Engineering(信息科学与工程学院) ; University of Information Technology(信息技术大学) ; Vietnam National University(越南国家大学)
专题命中 红外-可见光融合 :multimodal fusion(title,abstract);分类 cs.CV
AI总结 本文提出HSTFG和PhonoSTFG框架,通过图拓扑分析发现跨模态边对场景文本融合有害,并构建首个大规模越南语场景文本描述数据集ViTextCaps,揭示52.8%词汇存在声调符号冲突风险。