Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
Comments update the abstract and cite a new related work
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
多模态大语言模型的演进安全态势:新兴威胁与防护措施综述
机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; NVIDIA(英伟达公司) ; Penn State University(宾夕法尼亚州立大学) ; Columbia University(哥伦比亚大学) ; University of Missouri-Kansas City(密苏里大学堪萨斯分校) ; Florida State University(佛罗里达州立大学) ; Auburn University(奥本大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)
AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI
突破边界模型仍保留其能力
机构 * Anthropic
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究发现,模型能力越强,越能抵御 jailbreak,且推理任务比知识回忆任务更易受攻击,边界点 jailbreaking 几乎无损安全模型。
合成角色预训练:从零开始的对齐
机构 * EPFL(洛桑联邦理工学院) ; University of Toronto(多伦多大学) ; Northeastern University(东北大学) ; SJTU(上海交通大学) ; Saarland University(萨尔大学) ; Hereon(亥姆霍兹极地与海洋研究中心) ; TUHH(汉堡工业大学) ; Ontocord AI(Ontocord人工智能公司) ; TUC(德累斯顿工业大学) ; DFKI(德国人工智能研究中心)
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。
上半场打破拒绝:预填充越狱的机制研究
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究语言模型中预填充消除拒绝的现象,通过实验定位到早期窗口,揭示拒绝是浅层响应端计算,预填充控制是通用自回归条件作用,还明确了主导机制及相关特征,指出监测器免疫特点和机制的分散性与失效表面的局部性。
Comments 31 pages, 3 figures. Code and derived artifacts: https://github.com/collapseindex/breaking-refusal
追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示
机构 * Columbia University(哥伦比亚大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。
你真的需要GPU来保护你的LLM吗?用于大规模安全执行的CPU级分类器与多阶段流水线
机构 * BITS Pilani(比斯帕利尼大学) ; Trustwise(Trustwise公司)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究CPU级分类器(如SVM、梯度提升树)在LLM输入安全检测中的性能,发现其与GPU模型互补,并设计三阶段流水线GuardChain,在80%的分布内查询中达到近峰值精度,降低部署成本。
Comments Under Review. 25 pages, 5 figures, 38 tables
通过流形轨迹动力学防御大语言模型的越狱攻击
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。
Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk
SkillSafetyBench:在技能面攻击表面下评估智能体安全性
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。
越狱以保护:通过临时越狱进行缓冲和强化以实现大型语言模型的安全微调
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电子工程学院)
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对微调即服务中安全对齐被有害微调攻击削弱的问题,提出一种基于梯度分析的缓冲与强化框架,通过临时越狱适配器减少有害更新并利用QR分解合并强化安全,实现无需额外安全数据的高效防御。
Comments ICML 2026 Spotlight
Faster-GCG: 面向对齐大语言模型的高效离散优化监狱突破攻击
机构 * Tsinghua University(清华大学) ; Sea-Fill ; Duke University(杜克大学) ; Aalborg University(奥胡斯大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Faster-GCG,通过改进估计、高效采样和避免重复评估,提高了对齐大语言模型的监狱突破攻击效率,实现了样本效率提升8倍,时间减少7倍,并在多个模型上取得了更高的突破成功率。
Comments 18 pages, new version
声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。
Comments 43rd International Conference on Machine Learning (ICML'26)
RACC:面向LLM安全测试的表示感知覆盖标准
机构 * Peking University(北京大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RACC,一种专为LLM安全测试设计的覆盖标准,通过提取安全表示并评估测试提示的激活情况,有效提升测试套件质量,同时对冗余输入不敏感,适用于大规模神经网络的安全测试。
GPO-V:通过全局概率优化实现扩散视觉语言模型的突破
机构 * ShanghaiTech University(上海科技大学) ; University of Warwick(沃里克大学) ; SUN YAT-SEN UNIVERSITY(中山大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。
通过安全感知探测实现安全的大语言模型微调
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文探讨了非有害数据微调为何可能降低安全性,提出安全感知探测框架,通过对比安全信号定位安全相关方向,优化轻量级探针以引导参数更新远离有害轨迹,提升安全与性能的平衡。
GAMBIT:一种用于多模态大语言模型的游戏化突破框架
机构 * Georgia State University(佐治亚州立大学) ; Shandong University(山东大学) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。
Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference
通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御
机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);trustworthy(abstract)
AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。
Comments CVPR 2026
安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)
AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。
Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)
Jailbreak-as-a-Service++:揭示由LLM众包驱动的分布式恶意信息活动
机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; China People’s Public Security University(中国人民公安大学) ; Tongji University(同济大学) ; South China Normal University(华南师范大学) ; Tsing Hua University(清华大学)
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Jailbreak-as-a-Service++研究通过LLM众包技术揭示分布式恶意信息活动,提出PoisonSwarm方法提升恶意任务生成效率并提出生态系统级防御需求。
通用劫持后缀是强大的注意力劫持者
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文研究了基于后缀的劫持攻击,发现通用后缀能更有效地劫持LLM的上下文化过程,并提出通过提升后缀普遍性来增强攻击效果,同时提供缓解方法。
Comments Accepted at TACL 2026
OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱
机构 * Nanyang Technological University, Singapore(南洋理工大学) ; BraneMatrix AI, China(BraneMatrix AI) ; Chongqing University, China(重庆大学) ; Xi’an Jiaotong University, China(西安交通大学) ; Northeastern University, China(东北大学) ; Sun Yat-sen University, China(中山大学) ; Alibaba, China(阿里巴巴) ; National University of Singapore, Singapore(新加坡国立大学) ; ByteDance, China(字节跳动)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。
医疗恶意:用于医疗LLM中情境感知安全的数据库
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。
通过过拟合攻击:10次良性微调以劫持LLMs
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 通过10个良性QA对微调实现LLM劫持,利用过拟合增强敏感性,提升攻击效果与隐蔽性。
Comments Published as a conference paper at NeurIPS 2025
BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞
机构 * Theori Inc.(Theori公司)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。
Comments Accepted as a workshop paper at AAAI 2026