Inadvertent Context Leakage in Language Models
语言模型中的无意上下文泄漏
机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。