Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
说服攻击会降低思维链监测的有效性
机构 * LASR Labs(LASR实验室) ; University College London(伦敦大学学院) ; Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :CoT(title,summary_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。
Comments 25 pages, 10 figures