PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage
PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准
机构 * Emory University(埃默里大学) ; Scale AI ; Mayo Clinic(梅奥诊所) ; Vanderbilt University Medical Center(范德比大学医学中心)
AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。