MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety
MultiTurnPSB:评估多轮越狱攻击与基于分类器的防御在医疗AI安全中的应用
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 临床大模型 :medical AI(title)
AI总结 提出多轮对抗基准MultiTurnPSB,通过四轮对话评估医疗聊天机器人的安全漏洞,发现多轮攻击下不安全响应率从35%升至近80%,并验证了轻量级输入分类器可降低52个百分点的不安全响应但存在高误报率。