arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2606.02630 2026-06-03 cs.CR cs.AI 90%

MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety

MultiTurnPSB:评估多轮越狱攻击与基于分类器的防御在医疗AI安全中的应用

Anushka Sheoran, Yiduo Hao

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title);AI safety(title);分类 cs.AI

AI总结 提出多轮对抗基准MultiTurnPSB,通过四轮对话评估医疗聊天机器人的安全漏洞,发现多轮攻击下不安全响应率从35%升至近80%,并验证了轻量级输入分类器可降低52个百分点的不安全响应但存在高误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09755 2026-06-03 cs.CR cs.LG 85%

Jailbreak Attack Initializations as Extractors of Compliance Directions

越狱攻击初始化作为合规方向的提取器

Amit Levi, Rom Himelstein, Yaniv Nemcovsky, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion - Israel Institute of Technology(技术学院计算机科学系) Department of Data and Decision Science, Technion - Israel Institute of Technology(技术学院数据与决策科学系) School of Electrical and Computer Engineering Engineering, Ben-Gurion University of the Negev(内盖夫本· Gurion大学电气与计算机工程学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文发现基于梯度的越狱攻击初始化会收敛到抑制拒绝的单一合规方向,并据此提出CRI框架,通过沿合规方向投影未见提示来提高攻击成功率并降低计算开销。

Comments Accepted to Findings of the Association for Computational Linguistics 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03486 2026-06-03 cs.CR cs.AI 83%

NeuroArmor: Safe-Variant-Guided Representation Consistency for Selective Re-Anchoring in Jailbreak Defense

NeuroArmor:基于安全变体引导的表示一致性实现越狱防御中的选择性重新锚定

Zhongyang Lin, Ziran Zhao, Feifei Zhai, Pengyuan Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出NeuroArmor白盒运行时防御方法,通过为每个提示构建安全变体作为局部安全参考,在隐藏状态空间进行一致性检查并路由异常,有效降低恶意攻击成功率同时保持低误报率。

Comments 16 pages, 4 figures, 17 tables. Submitted to ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02822 2026-06-03 cs.CR cs.AI 70%

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing

哪种防御措施应对哪种威胁?归因OWASP-LLM-Top-10覆盖及其在释义下的脆弱性

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文通过归因分析,测量了不同防御家族(拒绝过滤、预算控制等)对OWASP-LLM-Top-10威胁的覆盖情况,并揭示了拒绝防御在释义攻击下的脆弱性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02640 2026-06-03 cs.CR cs.AI 70%

D-Judge: Disrupting Multi-Turn Jailbreaks using Semantics-Preserving Output Rewriting

D-Judge: 使用语义保持输出重写破坏多轮越狱攻击

Huanli Gong, Zhipeng Wei, Yu Fu, Haz Sameen Shahgir, Ananya Gupta, Yue Dong, N. Benjamin Erichson

机构 * University of California, Berkeley(加州大学伯克利分校) International Computer Science Institute(国际计算机科学研究所) University of California, Riverside(加州大学河滨分校) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出D-Judge防御方法,通过语义保持的输出重写干扰攻击者的评判模型反馈循环,从而降低多轮越狱攻击的成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG 62%

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03695 2026-06-03 cs.CL 57%

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

不要忘记你的嵌入:通过精确编辑嵌入实现鲁棒的知识擦除

Clara Haya Suslik, Or Shafran, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(巴尔-艾赫伦计算机科学与人工智能学院,特拉维夫大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 提出 EMBER 模块,利用稀疏矩阵分解精确擦除词嵌入中的概念相关特征,增强现有知识擦除方法的鲁棒性和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03136 2026-06-03 cs.CR cs.CL 57%

PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

PsychoPass: 多轮对抗性LLM对话的几何轮廓分析

Muberra Ozmen, Subhabrata Majumdar

机构 * Coveo Montreal, QC, Canada(加拿大蒙特利尔 Coveo) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出PsychoPass框架,通过提取对话轨迹在嵌入空间中的几何特征,在有害内容生成前预测多轮越狱攻击,并发现早期几何信号具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏