MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
MASCing:通过激活引导掩码实现可配置的专家混合行为
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 MASCing通过LSTM模型捕捉跨层路由依赖,利用引导矩阵优化专家电路,实现无需重新训练的MoE行为灵活重构,提升安全场景下的模型性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
MASCing:通过激活引导掩码实现可配置的专家混合行为
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 MASCing通过LSTM模型捕捉跨层路由依赖,利用引导矩阵优化专家电路,实现无需重新训练的MoE行为灵活重构,提升安全场景下的模型性能。
潜在对抗检测:适应性探测LLM激活以多轮攻击检测
机构 * Mountain View, CA(山景城,加利福尼亚州)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。