Adaptively Robust LLM Monitoring via Activation Watermarking
通过激活水印实现语言模型的鲁棒安全监控
机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 安全训练 :jailbreak(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出通过激活水印技术提升语言模型的安全监控能力,针对适应性攻击者设计改进防御策略,有效提升检测准确率。
Comments 17 pages, 17 figures, 8 tables