Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
激活引导用于不牺牲连贯性的对齐开放式生成
机构 * Tara Research ; Technical University of Munich(慕尼黑工业大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。
Chameleon: 通过ML代理从内存破坏攻击中恢复信息物理系统
专题命中 越狱攻击 :safety(abstract)
AI总结 提出Chameleon框架,利用基于机器学习的代理在检测到攻击时替换受损组件,实现信息物理系统从内存破坏攻击中的自动恢复,在多种机器人车辆上验证了高保真度和低开销。