A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models
医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
机构 * John Snow Labs Inc.(约翰·索克斯实验室公司)
专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
AI总结 提出一个多领域红队框架,通过690个临床场景评估11个当代大语言模型,发现平均准确率掩盖了临床意义上的风险,性能方差和最坏情况失败比平均准确率更能反映可靠性,混合评估方法对可信安全评估至关重要。
Comments 10 pages, 4 figures. To be presented at the Text2Story 2026 Workshop (Delft, The Netherlands, 29 March 2026); CEUR Workshop Proceedings (forthcoming). Affiliation: John Snow Labs Inc