ImgTrojan: Jailbreaking Vision-Language Models with ONE Image
机构 * The University of Hong Kong(香港大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * The University of Hong Kong(香港大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
机构 * Fudan University(复旦大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 19 pages
机构 * Imperial College London(伦敦帝国学院) ; California Institute of Technology(加州理工学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.LG
Comments 25 pages, 15 figures. Accepted at COLM 2025 SoLaR Workshop
机构 * College of Cyber Science, Nankai University(南开大学网络科学学院) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Nanyang Technological University(新加坡国立大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Accepted at ICLR 2025
Journal ref Proceedings of The Thirteenth International Conference on Learning Representations (ICLR 2025)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 13 pages,2 figures, accepted by COLING 2025
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Published as a conference paper at COLM 2024 (https://colmweb.org/index.html)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 12 pages, 9 figures, EMNLP 2024 Findings
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Accepted for ICLR 2024 Oral Presentation. 15 pages (main text) and 5 pages (appendix)
机构 * AIM Intelligence(AIM智能)
专题命中 越狱攻击 :jailbreak(title);分类 cs.CL、cs.AI
Comments NeurIPS 2025 Workshop on Lock-LLM
SafeFlow:用于多智能体系统中阻止恶意传播的语义信息流控制
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 研究多智能体系统恶意传播问题,提出SafeFlow框架,将恶意跨智能体传播形式化为语义信息流问题,通过附加污点、传播及工作流级验证重建风险上下文,经测试降低攻击成功率,保持良性任务完成率,揭示系统缺乏跨委托边界保留风险语义机制。
TYPO:针对商业闭源图像生成模型的指令密集型视觉越狱
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 研究针对商业闭源图像生成模型安全漏洞,提出TYPO框架,通过自动生成对抗性排版提示,利用文本和视觉双通道策略空间及自适应组合搜索,有效实现指令密集型视觉越狱,性能优于其他攻击且成本低。
通过信息过载对大型视觉语言模型进行越狱攻击
机构 * National University of Singapore(新加坡国立大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。
大语言模型通过一种独特的统一机制生成有害内容
机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学) ; Cohere ; Technion—IIT(以色列理工学院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。
关闭激活锥盲点:响应时间探测与统一防御
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型推理时安全方法,发现提示时激活防御对预填充攻击存在结构性盲点,提出响应时间探测(线性探针)结合停止机制,将预填充攻击成功率降至0,并与AlphaSteer组合实现正交防御。
Comments 27 pages, 12 figures, 18 tables. Code and data: https://github.com/bassrehab/response-time-probing
中间层知道什么:从熵动力学检测越狱
机构 * LMU Munich(慕尼黑大学) ; relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 康拉德·楚泽可靠人工智能卓越学校) ; University of Pisa(比萨大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; School of Engineering, Computing and Mathematics, Oxford Brookes University(牛津布鲁克斯大学工程、计算与数学学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分析冻结LLM各层的token级预测熵轨迹,发现中间层的熵动力学特征(如基于排名的单调趋势分数)能有效检测越狱攻击,且无需额外训练。
Comments Accepted at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD) 2026. A short version accepted at EIML@ICML 2026
与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?
机构 * Northeastern University(东北大学)
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。
Comments 34 pages, 30 figures, 3 tables
多轮自适应提示攻击对大型视觉-语言模型
机构 * The University of Melbourne(墨尔本大学) ; The University of Adelaide(阿德莱德大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。
切肉威胁:在LLM系统中利用累积风险
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Sun Yat-sen University(中山大学) ; Wuhan University(武汉大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; ByteDance(字节跳动) ; Singapore Management University(新加坡管理大学)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。
PRISM:基于图像序列操作的程序化推理用于LVLM劫持
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。
Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246
PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。
恶意示例:通过模板填充和不安全推理实现大语言模型的劫持
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。
Comments under review
大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。
DP-Fusion: 令牌级差分隐私推理用于大语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) ; Massachusetts Institute of Technology (MIT)(麻省理工学院)
专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。
Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com