Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
专题命中 红队测试 :red teaming(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。