MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety
MultiTurnPSB:评估多轮越狱攻击与基于分类器的防御在医疗AI安全中的应用
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title);AI safety(title);分类 cs.AI
AI总结 提出多轮对抗基准MultiTurnPSB,通过四轮对话评估医疗聊天机器人的安全漏洞,发现多轮攻击下不安全响应率从35%升至近80%,并验证了轻量级输入分类器可降低52个百分点的不安全响应但存在高误报率。