MULTIVERSE: Exposing Large Language Model Alignment Problems in Diverse Worlds
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG
具身人工智能的安全性:风险、攻击与防御综述
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学) ; Jilin University(吉林大学) ; Singapore Management University(新加坡管理大学) ; Deakin University(德肯大学) ; Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学) ; Chinese Academy of Sciences(中国科学院) ; The University of Melbourne(墨尔本大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文综述了具身AI在感知、认知、规划、行动及交互全流程中的安全风险、攻击与防御方法,提出了多层次分类体系,并指出了多模态感知融合脆弱性、规划不稳定及人机交互可信度等关键挑战。
Comments Survey paper; 75 pages, 4 figures, 18 tables; v2 expands embodied-specific coverage of agentic threats, World Action Model threats, and contextual risk mitigation, with over 100 new references added. Project page: https://x-zheng16.github.io/Awesome-Embodied-AI-Safety/
机构 * Northwestern University(西北大学) ; University of Illinois at Chicago(伊利诺伊大学香槟分校)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI;trustworthy(comments)
Comments accepted by the Trustworthy FMs workshop in ICCV 2025
ProbGuard:基于大语言模型输出分布的校准安全风险估计
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究针对现有LLM安全防护的确定性范式局限,提出概率架构无关防护框架ProbGuard,利用早期输出分布信号校准安全风险,实现提前终止不安全输出,在9种组合设置及6种越狱攻击中均表现优异。
逐词进行:增量完成分解打破LLM安全
机构 * University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出增量完成分解(ICD)策略,通过逐词生成恶意请求相关词来突破LLM安全机制,评估多种变体在多个基准测试中表现优异,并理论解释其有效性。
检索增强防御:针对大语言模型的自适应且可控制的越狱防范
机构 * Department of Engineering University of Cambridge(工程系剑桥大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
AI总结 针对大语言模型越狱攻击的挑战,提出检索增强防御(RAD)框架,在StrongREJECT数据集上验证其可降低强力越狱攻击有效性,同时平衡安全性与实用性。
最小、局部、因果解释用于大语言模型中的对抗成功
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了大语言模型对抗成功的因果机制,提出LOCA方法通过局部解释识别最小的中间表示变化,以解释对抗成功的原因。
Comments Published at COLM 2026 (updated bib)
受扰动越狱提示的几何配置
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究Qwen和Llama系列小权重模型中受扰动越狱输入的内部表示,选两个表示空间,在拒绝主导答案集中两空间均无行为超平面,仅特定模型的个别token与合规答案有关联。
Comments 21 pages, 9 figures, 7 tables, 2nd Workshop on Safe AI (SafeAI)
在聊天中被拒绝,用代码编写:IDE 编码代理中的工作流级越狱构造
机构 * The Alan Turing Institute(阿尔法·图灵研究院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究 IDE 编码代理安全评估问题,介绍工作流级越狱构造,通过对特定模型在不同基准测试下表现研究发现,对话拒绝基准可能高估其安全性,需跨多轮 IDE 工作流评估安全。
打破刹车,而非车轮:通过熵最大化实现无目标越狱
机构 * Australian National University(澳大利亚国立大学) ; The University Of Queensland(昆士兰大学) ; Peking University(北京大学) ; GE research(通用电气研究院) ; CSIRO(澳大利亚联邦科学与工业研究组织)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出UJEM-KL攻击方法,通过最大化决策令牌的熵来翻转视觉-语言模型的拒绝输出,实现高迁移性的无目标越狱。
Comments Preprint. 17 pages, 8 figures, 6 tables
PixJail:面向文本到图像越狱评估的自演化论文到流水线复现
机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) ; East China Normal University(华东师范大学) ; Shanghai Qi Zhi Institute(上海启智研究院) ; Wuhan University(武汉大学) ; Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) ; CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。
JailbreakOPT: 工具辅助的迭代越狱提示优化
机构 * University of California, Davis(加州大学戴维斯分校) ; The Renmin University of China(中国人民大学) ; Independent Researcher(独立研究员) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出JailbreakOPT框架,通过工具库和上下文Thompson采样优化单轮越狱提示,在多个LLM上提高攻击成功率并减少攻击次数。
一次越狱,多种语言:学习语言无关的意图表示用于多语言越狱检测
机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) ; School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
AI总结 针对多语言LLM安全漏洞,提出MLJailDe框架,通过多语言回译数据增强和相对距离约束,实现跨语言越狱检测,F1达98.5%。
GradShield: 保持对齐的微调
机构 * University of California, Berkeley(加州大学伯克利分校) ; HUMAIN ; King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) ; University of Washington, Seattle(华盛顿大学(西雅图))
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。
NeuroArmor:基于安全变体引导的表示一致性实现越狱防御中的选择性重新锚定
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出NeuroArmor白盒运行时防御方法,通过为每个提示构建安全变体作为局部安全参考,在隐藏状态空间进行一致性检查并路由异常,有效降低恶意攻击成功率同时保持低误报率。
Comments 16 pages, 4 figures, 17 tables. Submitted to ACL ARR
超越攻击成功率:LLM安全失效的时间对数可观测性
机构 * Chung-Ang University(Chung-Ang 大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出时间对数可观测性(TLO)方法,通过解码过程中的合规-拒绝边际将模型-攻击条件映射到校准的二维平面,揭示攻击成功的时间模式,并基于此设计早期停止规则将成功越狱减少一半以上。
SelfGrader: 基于锚定令牌级对数概率的LLM越狱检测
机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 提出SelfGrader方法,利用锚定令牌级对数概率将越狱检测转化为数值评分问题,实现低延迟、低误报率的鲁棒检测。
大型语言模型中通过潜在激活引导的文化价值对齐
机构 * University of Copenhagen(哥本哈根大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 提出一种基于场景行为探测和潜在激活引导的框架,用于评估和干预LLMs的文化价值,发现文化价值以耦合结构编码,限制了精确对齐。
Comments ACL 2026 Student Research Workshop (Non-Archival Track)
StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。
Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content
动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法
机构 * Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。
EVA:针对对抗性攻击的多功能对齐编辑
机构 * ShanghaiTech University(上海科技大学) ; Sun Yat-sen University(中山大学) ; State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Tsinghua University(清华大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。
Comments IEEE TPAMI 2026
基于外部化攻击-防御共演的模型无关持续LLM安全
机构 * City University of Hong Kong(香港城市大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 越狱攻击 :safety(title,abstract);red teaming(abstract);分类 cs.CL
AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。
Comments 48 pages, 7 figures
利用生存分析量化LLM在反复攻击下的安全退化
机构 * MuyVentive, LLC(MuyVentive公司)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出利用生存分析评估LLM在持续对抗压力下的安全退化,揭示不同模型在多次攻击下的脆弱性差异,为模型开发者提供评估方法。
潜在指令表示对齐:防御对抗性指令、后门和不期望知识在大语言模型中的攻击
机构 * ML Alignment & Theory Scholars(机器学习对齐与理论学者)
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出LIRA方法,通过改变模型对指令的解释方式提升泛化能力,并通过内部对抗训练算法进一步增强泛化,有效防御了99%以上的PEZ对抗攻击,移除了一个具有挑战性的不安全代码后门,并在WMDP网络中实现最优遗忘。
Comments 33 pages, 6 figures
见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全
机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) ; City University of Macau(澳门城市大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。
Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak
在RLVR中存在后门:从可验证奖励中对LLM的后门攻击
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。
Comments 20 pages,8 figures, publish in acl2026
Mosaic: 通过多视图集成优化实现对闭源视觉语言模型的多模态劫持
机构 * Beihang University(北京航空航天大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出Mosaic框架,通过多视图集成优化减少对单一代理模型的依赖,提升对闭源VLMs的多模态劫持效果,实验显示其在安全基准上的攻击成功率和毒性均达到最优。
Comments 14pages, 9 figures
通过合成演示增强医疗视觉-语言模型的安全性
机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; UC San Francisco(加州大学旧金山分校)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出一种新的推理时防御策略,通过合成临床演示提升模型安全性,同时平衡安全与性能。
扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式
机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft(微软)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。
通过人格提示增强大语言模型的劫持攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。
Comments Workshop on LLM Persona Modeling at NeurIPS 2025