Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models
有害吗?网络部署医疗大语言模型中的幻觉与作用层面滥用
机构 * The University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 本文研究了网络部署的医疗大语言模型中的幻觉和作用层面滥用问题,通过评估6233个MedGPT和10个开源LLM,发现25-30%的MedGPT事实准确性较低,33.6-54.3%违反操作阈值,57.06%的Action-enabled模型缺乏充分的隐私披露,揭示了系统性漏洞,强调了多指标评估和更强的安全保障的必要性。