SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 越狱攻击 :safety(title,abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 越狱攻击 :safety(title,abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。
ICO:通过迭代上下文优化增强语义偏移越狱攻击
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。
针对视频大语言模型中提示引导采样的投毒攻击
机构 * National University of Singapore(新加坡国立大学) ; University of New South Wales(新南威尔士大学) ; CSIRO’s Data61(CSIRO数据61)
专题命中 越狱攻击 :safety(abstract)
AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。
Comments 16 pages, 5 figures