CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios
MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准
机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Minhang Hospital, Fudan University(复旦大学附属闵行医院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。