JULI: Jailbreak Large Language Models by Self-Introspection
通过自我反思 jailbreak 大型语言模型:JULI
机构 * University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。
Comments Accepted to ICLR 2026