MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs
MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现
机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。