MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models
MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架
机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) ; Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) ; LILT
AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。
Comments 9 pages, preprint, submitted to EMNLP 2026