Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models
专题命中 越狱攻击 :jailbreak(title,abstract);RLHF(abstract)
Comments Accepted by AAAI 2025. Project page: https://huggingface.co/spaces/TrustSafeAI/Token-Highlighter
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(title,abstract);RLHF(abstract)
Comments Accepted by AAAI 2025. Project page: https://huggingface.co/spaces/TrustSafeAI/Token-Highlighter
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 Pages, 5 Figures, 8 Tables. Accepted by ACL 2024
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments 12 pages, 4 figures, 3 tables
Journal ref Appl. Sci. 14, 3558 (2024)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
Comments Publish by ICASSP 2024 on 3/18/2024; Extended Arxiv version
BarrierSteer: 通过学习障碍引导实现大语言模型安全
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) ; Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究中心) ; CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) ; Worcester Polytechnic Institute(沃斯堡理工学院)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 提出 BarrierSteer 框架,通过将学习到的非线性安全约束作为控制障碍函数嵌入潜在表示空间,在推理时引导模型生成安全内容,理论保证且不修改模型参数。
Comments This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs
打破数据库锁定:用于数据库绕过的高性能存储读取器的智能再生
机构 * Cornell University(康奈尔大学)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.AI
AI总结 研究分析工作负载面临的数据访问瓶颈问题,提出Jailbreak方法,利用大语言模型辅助代码合成绕过数据库引擎直接读取存储文件,在PostgreSQL和MySQL上评估,性能显著提升,证明该方法可打破数据库系统数据锁定。
Comments To be presented at AIDB 2026 (co-located with VLDB)
PAST2HARM:一种用于越狱多模态AI的简单自适应过去时攻击
机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡利安)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)
AI总结 提出PAST2HARM框架,通过过去时态改写和迭代升级策略,系统性地利用多模态文本到图像模型的安全漏洞,实现黑盒、无梯度的高成功率越狱攻击。
SRTJ:自演化规则驱动的无训练LLM jailbreaking
机构 * HKUST (GZ)(香港科技大学(广州)) ; Jilin University(吉林大学) ; Yale University(耶鲁大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL
AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。
注意差距:通过动作图评估LLM在模型和代理层面的漏洞
机构 * Holistic AI ; University College London(伦敦大学学院)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);分类 cs.CL
AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。
Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval
直行与狭窄:大型语言模型是否具有内在的道德路径?
机构 * School of Future Technology, Dalian University of Technology, China(大连理工大学未来技术学院) ; School of Computer Science and Technology, Dalian University of Technology, China(大连理工大学计算机科学与技术学院) ; Key Laboratory of Social Computing and Cognitive Intelligence, Ministry of Education, China(教育部社会计算与认知智能重点实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
AI总结 本文通过道德基础理论探索LLMs的道德表示,提出自适应道德融合方法,以增强模型的道德对齐性并减少安全与有用性之间的权衡。
为LLM突破限制而探索句子配对:恶意代码生成的测试框架
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。
Comments Accepted to FSE 2026
机构 * Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学) ; Department of Mathematics, Florida State University(数学系,佛罗里达州立大学)
专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
Comments ICML 2025
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
Comments Accepted by USENIX Security Symposium 2025. Please cite the conference version of this paper, i.e., "Xunguang Wang, Daoyuan Wu, Zhenlan Ji, Zongjie Li, Pingchuan Ma, Shuai Wang, Yingjiu Li, Yang Liu, Ning Liu, and Juergen Rahmel. SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner. In Proc. USENIX Security, 2025."
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024 Workshops: RBFM (Best Paper), Frontiers in AdvML (Oral), Red Teaming GenAI (Oral), SoLaR (Spotlight), SATA
引导向量的安全代价是可分离且可降低的
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。
Comments COLM 2026
恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度
机构 * Vertex AI(顶点人工智能)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。
Comments 15 pages, 2 figures, 7 tables
安全对齐的LLM从混合顺从演示中学到了什么?
专题命中 越狱攻击 :safety(title);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。
FENCE:一个金融和多模态越狱检测数据集
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。
Comments lrec 2026 accepted paper
智能体AI控制评估中的攻击选择显著降低安全性
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究攻击者策略性选择攻击时机对AI控制安全性的影响,通过分解攻击决策为开始和停止策略,实验表明两者均显著降低安全性,现有评估可能高估安全性。
SlotGCG:利用LLMs中的位置脆弱性进行越狱攻击
机构 * Dongguk University-Seoul(东国大学-首尔)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SlotGCG方法,通过量化提示中不同插入位置(槽)的脆弱性得分(VSS),选择最脆弱的位置插入对抗性令牌,从而显著提升基于优化的越狱攻击成功率。
Journal ref International Conference on Learning Representations (ICLR), 2026
大型语言模型的越狱缩放定律:多项式-指数交叉
机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) ; Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) ; Center for Brain Science, Harvard University(哈佛大学脑科学中心)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。
Mask-GCG:对抗性后缀中的所有标记对于越狱攻击都是必要的吗?
机构 * Politecnico di Milano(米兰理工学院) ; Beihang University(北京航空航天大学) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; University of the Chinese Academy of Sciences(中国科学院大学) ; AI Security Lab(360人工智能安全实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Mask-GCG方法,通过可学习的标记掩码识别后缀中高影响力标记并剪枝低影响力标记,降低计算开销并保持攻击成功率,揭示LLM提示中的标记冗余。
Comments Accepted to ICASSP 2026
Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 13887-13891, 2026