Jailbreaking in the Haystack
干草堆中的越狱攻击
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对长上下文语言模型,提出 NINJA 越狱攻击方法,利用有害目标位置的关键作用,在 HarmBench 基准上提升了多款先进模型的攻击成功率,且该方法低资源、可迁移、难检测、计算最优,揭示了长上下文可引入模型安全漏洞。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
干草堆中的越狱攻击
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对长上下文语言模型,提出 NINJA 越狱攻击方法,利用有害目标位置的关键作用,在 HarmBench 基准上提升了多款先进模型的攻击成功率,且该方法低资源、可迁移、难检测、计算最优,揭示了长上下文可引入模型安全漏洞。
打破最弱环节以规避视觉语言模型
机构 * ESILV(ESILV高等工程师学院) ; Thales(泰雷兹集团)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。
Comments 17 pages
从提示到扰动:针对音频大语言模型的自适应语音越狱框架
机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) ; University of Chicago(芝加哥大学) ; University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。
Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)
网联车辆中的自主网络防御:一种面向V2X安全的多智能体方法
专题命中 越狱攻击 :safety(abstract)
AI总结 针对网联车辆V2X安全,提出三层多智能体架构,以SAE标准时序为硬性约束,分层处理消息分类、冲突解决与模型优化,解决现有入侵检测系统的安全-安保冲突问题。