When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations
当大型语言模型在医疗保健中失败:评估对提示变化的敏感性
机构 * Department of Computer Science and Engineering, Doha, Qatar(计算机科学与工程系,多哈,卡塔尔)
专题命中 临床大模型 :diagnosis(abstract);分类 cs.LG
AI总结 本研究系统分析了通用和医学专用LLM对提示扰动的敏感性,发现即使是微小的措辞变化也可能改变临床建议,对抗性提示可能引发有害输出,表明这些模型在临床应用中不可靠。
Comments 12 pages