Jailbreaking GPT-4V via Self-Adversarial Attacks with System Prompts
专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.AI、cs.LG
专题命中 越狱攻击 :safety(abstract);red teaming(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL;trustworthy(journal_ref)
Comments Accepted at SeT-LLM @ ICLR 2024
Journal ref ICLR 2024 Workshop on Secure and Trustworthy Large Language Models
神经符号AI中的安全性、安全性和认知风险
专题命中 越狱攻击 :safety(title)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性
专题命中 越狱攻击 :safety(title)
AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。
专题命中 越狱攻击 :jailbreak(title)
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
DYNASHIELD:一种通过动态解码定制实现的大语言模型黑盒移动目标防御
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 DYNASHIELD是一种无需访问模型内部或重新训练的黑盒LLM防御框架,通过动态定制解码配置降低了4种越狱攻击的成功率,同时保持响应质量且开销极小。
Comments Accepted by The 29th International Symposium on Research in Attacks, Intrusions and Defenses (RAID) 2026
大语言模型知道它们的脆弱场景吗?
机构 * Renmin University of China(中国人民大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Wuhan University(武汉大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型在特定场景下的脆弱性,提出Concept2Scenario框架,通过实例化概念空间、归因拒绝抑制等步骤发现脆弱场景,在多模型和基准测试中验证,能提高攻击成功率、可迁移且组合效果优。
Comments 19 pages, 11 Figures, Under Review
基于角色特征的涌现失配数据归因
机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。
语用攻击面:大语言模型中隐式上下文的漏洞
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出大语言模型存在语用攻击面漏洞,利用人类语言解读与安全对齐的隐式上下文不匹配,所提攻击方法在各类模型上的成功率大幅优于基线方法。
用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏
机构 * Clemson University(克莱姆森大学)
专题命中 越狱攻击 :alignment(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
诱饵图像增强针对编码越狱的字幕介导防御
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。
Comments There is bug in algorithm implementation
前沿大语言模型中新兴生物安全风险的早期预警
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。
Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements
动态目标攻击
机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) ; Nanyang Technological University(南洋理工大学) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科技大学) ; SUN YAT-SEN UNIVERSITY(孙中山大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 动态目标攻击通过利用目标模型自身响应作为自适应目标,提高了对抗攻击的成功率和效率。
ICO:通过迭代上下文优化增强语义偏移越狱攻击
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。
安全智能体AI:从单步行动检查到轨迹保障
机构 * Purdue University(普渡大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该研究围绕自主智能体安全领域,梳理了单智能体、多智能体及宏观层面的各类安全挑战,提出安全需成为智能体架构等的可验证属性,为可信自主智能体部署提供路线图。
Comments 6 pages. Accepted to the ACM AI Leadership Summit 2026 (Visionary Track)
MJ:通过分解信用分配实现多轮语言模型越狱
机构 * POSTECH GSAI(浦项科技大学全球人工智能学院) ; Samsung SDS(三星 SDS)
专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.CL
AI总结 研究针对多轮语言模型越狱的信用分配难题,提出DC-GRPO框架,通过结合即时和未来信用为各轮次分配学习信号,经静态和动态加权规则实例化,在多模型和基准测试中显著优于现有方法,核心优势在于轮次级组相对信用分配。
Comments 29 pages. Warning: This paper contains examples of harmful content
通过内部归因图对大语言模型越狱进行机制性可解释性研究
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。
非文本目标攻击
机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) ; School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) ; School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) ; King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。
超越提示:通过模拟审核轨迹越狱函数调用大语言模型
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。
关于优化口语语言模型的多模态越狱攻击
机构 * Saarland University(萨尔大学) ; DFKI GmbH(德国人工智能研究中心) ; ETH AI Center(ETH人工智能中心)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。
Comments Accepted at INTERSPEECH 2026
当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。
SafeSpec: 通过动态反射采样实现快速且安全的LLM
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; Huawei(华为) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。
论神经网络的满射性:你能从模型中诱导出任何行为吗?
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文证明现代神经网络架构(如预层归一化和线性注意力模块)几乎总是满射,意味着任何输出(包括有害内容)原则上都可生成,揭示了模型在对抗攻击下的固有脆弱性。
Comments Blog: https://astro-eric.github.io/blogs/surjective/
从ASR到ASP:评估针对开源大语言模型的提示攻击漏洞
机构 * LMU Munich(慕尼黑莱茵恩大学) ; RUB Bochum(波恩鲁姆大学) ; MCML ; A*STAR(新加坡科技研究局)
专题命中 越狱攻击 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 提出攻击成功概率(ASP)指标,评估14个开源和3个闭源LLM对提示注入攻击的脆弱性,发现催眠攻击可达约90% ASP,忽略前缀攻击可突破所有开源模型。
Comments 8 pages, 2 figures, EMNLP 2026 under review
混合对抗防御用于自然语言理解任务
机构 * School of Electronics and Computer Science, University of Southampton, UK(南安普顿大学电子与计算机科学学院) ; Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系)
专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL
AI总结 提出一种结合熵、不确定性和几何特征的混合防御框架,在多个自然语言理解数据集上同时提升了干净任务性能和对抗鲁棒性。
哪种防御措施应对哪种威胁?归因OWASP-LLM-Top-10覆盖及其在释义下的脆弱性
机构 * Lumytics
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文通过归因分析,测量了不同防御家族(拒绝过滤、预算控制等)对OWASP-LLM-Top-10威胁的覆盖情况,并揭示了拒绝防御在释义攻击下的脆弱性。
Comments 17 pages, 4 figures, 7 tables
D-Judge: 使用语义保持输出重写破坏多轮越狱攻击
机构 * University of California, Berkeley(加州大学伯克利分校) ; International Computer Science Institute(国际计算机科学研究所) ; University of California, Riverside(加州大学河滨分校) ; Lawrence Berkeley National Laboratory(伯克利国家实验室)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出D-Judge防御方法,通过语义保持的输出重写干扰攻击者的评判模型反馈循环,从而降低多轮越狱攻击的成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning