What Do Safety-Aligned LLMs Learn From Mixed Compliance Demonstrations?
安全对齐的LLM从混合顺从演示中学到了什么?
专题命中 越狱攻击 :safety(title);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
安全对齐的LLM从混合顺从演示中学到了什么?
专题命中 越狱攻击 :safety(title);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。
自主性税:防御训练破坏LLM智能体
机构 * University of Southern California(南加州大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。
SafeSpec: 通过动态反射采样实现快速且安全的LLM
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; Huawei(华为) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。
分析针对基于模型引导的自动化攻击的防御性误导策略在智能体AI系统中的应用
机构 * Application & Threat Intelligence Research Center(应用与威胁情报研究中心)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 本文通过概率模型分析智能体AI系统的攻击-防御场景,提出“检测-误导”策略(如CMPE)以替代传统“检测-拦截”方法,通过产生误导性响应降低攻击者成功率,并在基准测试中将攻击成功率上限降低两个数量级。