CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning
CHASE:利用强化学习进行对抗性红蓝队训练以提高LLM安全性
机构 * University of New South Wales(新南威尔士大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 提出CHASE框架,通过红蓝队协同进化(红队使用GRPO生成对抗性改写,蓝队使用两阶段GRPO+拒绝采样SFT进行防御),在保持良性提示零误拒的同时将攻击成功率降低43.2%。
Comments Under Review at ARR