Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability
评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准、失败与指标可靠性
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) ; North-West University(西北大学)
AI总结 本研究评估了四种大语言模型在英语到豪萨语和丰贝语(两种西非低资源语言)的翻译质量,发现质量因语言而异,模型排名不一致,且自动指标与人类判断的相关性波动大,建议采用多指标评估并注意神经指标的局限性。
Comments 19 pages, 10 tables