Jailbreaking is (Mostly) Simpler Than You Think
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 22 pages
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.LG
Comments 30 pages, 6 figures, 15 tables
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 16 pages
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.CL
Comments PACLIC 38
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.CL
Comments 2024 Conference on Empirical Methods in Natural Language Processing (Main)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
Comments Under review
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
Comments Multimodal Large Language Models Defense, 25 Pages
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Under Review
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.LG
Robust-LLaVA:大规模鲁棒图像编码器对多模态大语言模型的有效性
机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) ; Khalifa University(卡利法大学) ; Michigan State University(密歇根州立大学) ; Australian National University(澳大利亚国立大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);trustworthy(comments)
AI总结 本文提出利用大规模对抗预训练的图像分类模型替代CLIP编码器,以增强多模态大语言模型对视觉对抗扰动的鲁棒性,在无需额外对抗训练的情况下,在视觉问答、图像描述和越狱攻击任务中取得显著鲁棒性提升。
Comments Accepted at Trustworthy FMs Workshop Trust Before Use: Building Foundation Models that You Can Trust (ICCVW) 2025
执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。
Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security
演化技能结构攻击记忆增强大语言模型越狱
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
AI总结 提出MemAttack框架,通过技能结构化的攻击记忆建模、生命周期驱动的记忆演化和探索-利用平衡的记忆选择,实现高效的黑盒越狱攻击,在AdvBench上达到98.00%攻击成功率。
Comments Under review