LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
LongMedBench:用于长期临床决策的医疗智能体基准测试
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Transvascular Implantation Devices Research Institute(血管内植入装置研究所)
AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。
Comments Submitted manuscript prior to peer review in MICCAI 2026