Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment
通过推理启用的任务对齐防御自适应提示注入攻击
机构 * University of Waterloo(滑铁卢大学) ; Zhejiang University(浙江大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 提示注入 :prompt injection(title,abstract);alignment(title);safety(abstract);分类 cs.AI
AI总结 提出RETA方法,通过基于用户任务的多目标强化学习训练防御器,利用思维链推理验证行动一致性,并采用字典学习多样性奖励生成对抗样本,在六种自适应攻击下平均攻击成功率低于4%。