Uncovering Safety Risks of Large Language Models through Concept Activation Vector
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL
Comments 10 pages, accepted at NeurIPS 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL
Comments 10 pages, accepted at NeurIPS 2024
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title);safety(abstract);prompt injection(abstract);分类 cs.CL
专题命中 越狱攻击 :prompt injection(title);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 40 pages, 31 Figures
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(abstract);分类 cs.LG
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
Comments ICLR 2024
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL
大语言模型的越狱与漏洞缓解
机构 * Hunan University Changsha, PRC ; Georgia Institute of Technology Atlanta, USA ; Kyoto University Kyoto, Japan ; Purdue University West Lafayette, USA ; National Taiwan Normal University Taipei, ROC ; University of Liverpool Suzhou, PRC ; Hong Kong University of Science ; University of Hawaii Honolulu, USA ; The University of Texas at Dallas Dallas, USA ; University of Wisconsin-Madison Madison, USA ; Emory University Atlanta, USA ; College of William \& Mary Williamsburg, USA
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。
Journal ref Eureka 1(1) (2026) 26-61
Furina: 碎片化不确定性驱动的拒绝不稳定攻击
机构 * School of Intelligence Science and Technology(智能科学与技术学院) ; State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Nanjing University(南京大学)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 通过揭示大语言模型安全行为存在不稳定区域,提出多指标诊断框架并开发Furina攻击方法,利用碎片化场景提示诱导不确定性放大,实现高效越狱。
Comments This work is accepted as a regular paper at ICML 2026
层流假说:通过大语言模型中的语义湍流检测对抗性突破
机构 * Brac University(布拉克大学)
专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);red teaming(abstract)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);trustworthy(abstract)
SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。
Journal ref ICML 2026
基于原子越狱策略解耦与组合的多模态自动红队评估
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 针对现有多模态越狱攻击的两大挑战,本文提出HACA方法,构建多模态原子越狱策略空间,对5种主流MLLMs平均攻击成功率达95.48%。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
HarmRLVR: 利用可验证奖励进行有害大模型对齐
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 提出HarmRLVR,首次系统研究可验证奖励强化学习(RLVR)的对齐可逆性风险,通过仅64个有害提示的GRPO即可快速逆转安全对齐,攻击成功率高达96.01%。
追踪拒绝的动态:利用潜在拒绝轨迹进行鲁棒越狱检测
机构 * Peking University(北京大学) ; Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过因果追踪识别出稀疏的“拒绝轨迹”激活模式,并提出轻量级白盒检测器SALO,基于隐藏状态窗口实现鲁棒越狱检测。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version
椭球控制:通过良性潜在建模的白名单越狱防御
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)
AI总结 提出一种基于白名单视角的测试时防御方法Ellipsoid Control,通过拟合良性数据的各向异性椭球约束投影梯度下降,在任意输入上触发拒绝同时最小化良性潜在几何的扭曲,从而在增强安全性的同时保持模型效用。
Comments Under review by TIFS
从AI生成内容到代理行为:生成式AI中的安全与安全威胁
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract)
AI总结 研究探讨生成式AI从内容生成转向执行操作带来的安全与安全威胁,分析攻击者需求、系统自主性及潜在危害的变化,并评估检测、水印、对齐等技术对策,指出当前治理机制无法提供必要的协调。
Comments Accepted by Journal of Information and Intelligence (JII)