PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
PISmith: 基于强化学习的提示注入防御红队测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 提示注入 :prompt injection(title,abstract);red teaming(title);分类 cs.LG
AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。
Comments To appear in COLM 2026