When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries
当医疗安全对齐失败:评估LLMs在高风险医疗查询上的基准
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY
AI总结 提出MedHarm基准,包含1100个高风险医疗查询,评估15个LLM在毒理学、药理学等10个安全关键类别上的表现,发现对齐模型仍可能产生不安全响应,医疗微调会加剧危害,外部护栏存在脆弱性。
Comments 18 pages