How Robust Are Large Language Models for Clinical Numeracy? An Empirical Study on Numerical Reasoning Abilities in Clinical Contexts
大型语言模型在临床数字能力上的鲁棒性如何?一项关于临床情境中数值推理能力的实证研究
机构 * School of Computing Technologies, RMIT University(计算机技术学院,皇家墨尔本理工大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文通过ClinicNumRobBench基准测试,评估了17种LLM在临床情境下的数值推理能力,发现数值检索表现良好,但关系比较和聚合仍存在挑战,且医疗数据微调会降低数值能力。
Comments Accepted to ACL2026 Findings