Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models
愚人金:针对开放权重模型安全移除攻击的防御性欺骗
机构 * Microsoft Azure(微软Azure)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 针对开放权重模型易被移除安全对齐的问题,提出“愚人金”防御,通过训练仅在被攻击状态显现的伪造诱饵,使被攻击模型对危险请求输出高比例假回答,且无法区分真假,同时不影响干净状态的良性行为。