AmpleGCG-Plus: A Strong Generative Model of Adversarial Suffixes to Jailbreak LLMs with Higher Success Rates in Fewer Attempts
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
Comments Accepted by USENIX Security 2024
专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
Comments 13 pages, 6 figures
Journal ref The 62nd Annual Meeting of the Association for Computational Linguistics (ACL 2024)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
Comments Published at Fourth Workshop on TrustworthyNLP (TrustNLP) at NAACL 2024
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI
Comments 18 pages, 9 figures, Accepted in ACL 2024
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL
Comments Acccepted by NAACL 2024, 18 pages, 7 figures, 13 tables
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL
Comments Accepted by ICASSP 2024
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
Comments 11 pages
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL
MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
位置:AI安全政策应针对系统,而非模型
机构 * AI Safety Department(人工智能安全部门) ; SimulaMet and OsloMet(SimulaMet和奥斯陆计量)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。
自主性税:防御训练破坏LLM智能体
机构 * University of Southern California(南加州大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。
Patcher: 后门大型语言模型的事后修补
机构 * University of Louisville(路易斯维尔大学) ; University of North Texas(北得克萨斯大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。
Comments To appear in the USENIX Security Symposium, 2026
使用多片段视频破解多模态大语言模型
机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) ; Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。
Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026
失败的流形:语言模型中的行为吸引盆地
机构 * Amazon Web Services(亚马逊网络服务) ; Cisco(思科) ; Shrewd Security(精明安全)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种基于MAP-Elites的方法,用于系统地映射语言模型的失败流形,揭示不同模型的拓扑结构和漏洞分布。
面向角色的语言模型:用于组织中的安全且上下文化的访问控制
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Nazarbayev University(纳扎尔拜耶夫大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出面向角色的语言模型,通过三种策略实现基于组织角色的安全访问控制,并通过实验验证其在不同组织结构下的性能和鲁棒性。
Comments AACL 2025 - Main
迈向更安全的扩散语言模型:发现和缓解提示漏洞
机构 * Institute of Science Tokyo(东京科学研究所) ; RIKEN AIP(理化学研究所AIP)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文发现扩散语言模型存在因迭代去噪过程导致的提示漏洞,并提出针对性的安全对齐方法以缓解该问题。
Comments Accepted at ICLR 2026
TrailBlazer: 基于历史的强化学习用于黑盒大语言模型劫持
机构 * Daegu Gyeongbuk Institute of Science and Technology(大邱庆 bun 科学技术研究院) ; Harvard University(哈佛大学) ; University of Southern California(南加州大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI
AI总结 TrailBlazer通过历史感知强化学习提升黑盒大语言模型劫持效率,实现更高效的攻击策略和更高的查询效率。
奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持
机构 * S3IC-Lab(S3IC实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。
Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
Comments Accepted to NAACL 2025 Main (Oral)
机构 * Cyber Science Lab, University of Guelph(圭尔夫大学网络安全实验室) ; College of Engineering, University of Guelph(圭尔夫大学工程学院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI