ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准
机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。