Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge
Pre-Flight: 评估大型语言模型航空运营知识的基准
机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) ; Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。
Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)