Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
说服攻击会降低思维链监测的有效性
机构 * LASR Labs(LASR实验室) ; University College London(伦敦大学学院) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。
Comments 25 pages, 10 figures