Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain
基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距
机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)
专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract)
AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。
Journal ref 2025 CCF BigData