Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering
组合推理深度预测临床AI失败:与电子健康记录问答中Transformer组合性限制一致的实证证据
机构 * University of California San Francisco(加州大学旧金山分校) ; Waymark
专题命中 临床大模型 :clinical AI(title,abstract)
AI总结 本研究引入推理步数(hop count)作为预测大型语言模型在电子健康记录问答中失败的理论驱动指标,发现准确率随步数增加单调下降,且扩展思考未能显著改善,提示组合推理深度是跨架构的失败预测因子。
Comments 20 pages, 5 figures. Code: https://github.com/sanjaybasu/compositional-depth-clinical-ehr