RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation
RealICU: 大语言模型能否理解长期上下文ICU数据?一个超越行为模仿的基准测试
机构 * Technical University of Munich(慕尼黑技术大学) ; TUM University Hospital(TUM大学医院) ; LMU Munich(慕尼黑大学) ; University of Sheffield(谢菲尔德大学) ; University of Oxford(牛津大学) ; Zhongshan Hospital Fudan University(复旦大学中山医院) ; Sun Yat-sen University Cancer Center(中山大学肿瘤中心) ; Imperial College London(伦敦帝国学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 卡诺夫茨卓越可靠人工智能学校)
AI总结 RealICU通过真实ICU场景评估大语言模型的长期上下文理解能力,提出四个医生驱动任务,揭示现有模型在临床推荐中的召回与安全性的权衡问题。