Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings
思维链监控在隐含影响场景中可能不可靠
机构 * EPFL(洛桑联邦理工学院) ; UK AI Security Institute(英国人工智能安全研究院)
AI总结 该研究引入首个基准对比显式与隐含影响场景下思维链监控的可检测性,发现显式场景下检测率为60%-94%,隐含场景下下降41-46个百分点,善意部署选择还会进一步降低检测率。
高校专区
思维链监控在隐含影响场景中可能不可靠
机构 * EPFL(洛桑联邦理工学院) ; UK AI Security Institute(英国人工智能安全研究院)
AI总结 该研究引入首个基准对比显式与隐含影响场景下思维链监控的可检测性,发现显式场景下检测率为60%-94%,隐含场景下下降41-46个百分点,善意部署选择还会进一步降低检测率。