arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1714 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1714 篇

2506.17299 2026-04-27 cs.CR cs.AI cs.LG 93%

Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem

迈向原则化的LLM安全测试:解决 Jailbreak 或acle 问题

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出解决Jailbreak oracle问题的Boa系统,通过分阶段搜索策略评估大语言模型的安全性,实现系统化的防御评估和模型认证。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05644 2024-06-14 cs.CL cs.AI cs.CR cs.CY 92%

How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States

Zhenhong Zhou, Haiyang Yu, Xinghua Zhang, Rongwu Xu, Fei Huang, Yongbin Li

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20325 2026-05-12 cs.CL cs.AI cs.CV 92%

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Lapis Labs(Lapis实验室) Capital One

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09225 2026-05-12 cs.CR cs.AI cs.LG 92%

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

Jailbreak攻击的艺术:为LLM安全制定超越二进制评分的Jailbreak攻击

Ismail Hossain, Tanzim Ahad, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模组合式Jailbreak数据集、自动化生成方法及OPTIMUS评估器,系统性解决Jailbreak攻击的生成、分类与评估问题,揭示了安全与隐蔽最优区域。

Comments This paper is under review on of top security venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11629 2026-03-09 cs.LG cs.AI 92%

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

理性安全对齐:通过答案后检查确保对抗攻击防御

Chentao Cao, Xiaojun Xu, Bo Han, Hang Li

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR小组,计算机科学系,香港 Baptist大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出答案后检查方法,通过推理增强模型对抗攻击防御能力,实验表明其在安全性和效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06373 2024-01-25 cs.CL cs.AI 92%

How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs

Yi Zeng, Hongpeng Lin, Jingwen Zhang, Diyi Yang, Ruoxi Jia, Weiyan Shi

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages of the main text, qualitative examples of jailbreaks may be harmful in nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17971 2026-05-19 cs.CR cs.AI 92%

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学) University of Hong Kong(香港大学)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18118 2024-12-25 cs.CR cs.CL 92%

SafeAligner: Safety Alignment against Jailbreak Attacks via Response Disparity Guidance

Caishuang Huang, Wanxu Zhao, Rui Zheng, Huijie Lv, Wenyu Zhan, Shihan Dou, Sixian Li, Xiao Wang, Enyu Zhou, Junjie Ye, Yuming Yang, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14968 2024-06-21 cs.CR cs.CL 92%

Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment

Jiongxiao Wang, Jiazhao Li, Yiquan Li, Xiangyu Qi, Junjie Hu, Yixuan Li, Patrick McDaniel, Muhao Chen, Bo Li, Chaowei Xiao

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 91%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25716 2026-04-29 cs.CL cs.AI 91%

Cross-Lingual Jailbreak Detection via Semantic Codebooks

通过语义代码本进行跨语言 jailbreak 检测

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

机构 * AI Talent Hub, ITMO University(AI人才中心、ITMO大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过语言无关的语义相似性检测跨语言 jailbreak 攻击,评估了四种语言、两种翻译流程、三种嵌入模型和三种目标 LLM 的效果,发现语义相似性在标准基准上表现良好,但在分布偏移情况下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18775 2026-04-22 cs.CL cs.LG 91%

An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

多代采样在大型语言模型 jailbreak 检测中的实证研究

Hanrui Luo, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过JailbreakBench数据集和多种生成模型,评估了基于输出的jailbreak检测方法,发现单输出评估低估了模型漏洞,多代采样能更准确检测有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17152 2026-07-21 cs.CR cs.CL 新提交 91%

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

越狱攻击如何为安全对齐提供信息:以防御者为中心、基于Shapley值的越狱贡献评估

Yukai Zhou, Feiyang Lu, Xiaokai Mao, Jinfei Liu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(title);分类 cs.CL

AI总结 研究以防御者为中心评估越狱攻击,提出A - MESS框架,通过AttackSHAP估计攻击效用,在不同场景下实验发现攻击成功率排名与防御者效用弱对齐,有限查询能准确估计,直接优化子集安全效用更强,建议将越狱攻击视为安全改进资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03868 2026-02-25 cs.CL cs.AI cs.CR 91%

What Matters For Safety Alignment?

安全对齐中什么重要?

Xing Li, Hui-Ling Zhen, Lihao Yin, Xianzhi Yu, Zhenhua Dong, Mingxuan Yuan

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文研究了安全对齐中关键因素,发现集成推理和自我反思机制的重要性,揭示了CoT攻击的高成功率及安全风险,强调了安全约束在模型训练中的必要性。

Comments Added more commercial model results, majority voting scores, and theoretical analysis in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18058 2025-09-24 cs.LG cs.AI cs.CR 91%

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

Alexander Panfilov, Evgenii Kortukov, Kristina Nikolić, Matthias Bethge, Sebastian Lapuschkin, Wojciech Samek, Ameya Prabhu, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen & MPI for Intelligent Systems(图宾根ELLIS研究所与智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Fraunhofer HHI(弗劳恩霍夫高精尖研究所) ETH Zurich & ETH AI Center(苏黎世联邦理工学院与苏黎世人工智能中心) University of Tübingen(图宾根大学) TU Dublin(都柏林技术大学) TU Berlin & BIFOLD(柏林技术大学与BIFOLD)

专题命中 越狱攻击 :safety(title,abstract);AI safety(title);alignment(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 90%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 90%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00509 2025-11-04 cs.AI cs.CR 90%

Reimagining Safety Alignment with An Image

Yifan Xia, Guorui Chen, Wenqian Yu, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University, Wuhan, China(武汉大学信息管理学院) Torr Vision Group, University of Oxford, Oxford, United Kingdom(牛津大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07918 2026-07-10 cs.LG cs.AI cs.CL cs.CR 新提交 90%

Efficient Safety Alignment of Language Models via Latent Personality Traits

通过潜在人格特质实现语言模型的高效安全对齐

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) McGill University(麦吉尔大学) LawZero Université de Montréal(蒙特利尔大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。

Comments 15 pages, 6 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13788 2026-01-05 cs.LG cs.AI cs.CL cs.CR cs.MA 90%

Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments

对抗对齐中的扩展模式:来自多LLM jailbreak实验的证据

Samuel Nathanson, Rebecca Williams, Cynthia Matuszek

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过多LLM jailbreak实验揭示了模型大小不对称对对抗鲁棒性的影响,发现攻击者规模与有害输出严重性呈正相关,且攻击者对齐性可缓解有害响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20259 2025-05-27 cs.CR cs.AI cs.CL cs.LG 90%

Lifelong Safety Alignment for Language Models

Haoyu Wang, Zeyu Qin, Yifei Zhao, Chao Du, Min Lin, Xueqian Wang, Tianyu Pang

机构 * Sea AI Lab, Singapore(新加坡海智实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02630 2026-06-03 cs.CR cs.AI 90%

MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety

MultiTurnPSB:评估多轮越狱攻击与基于分类器的防御在医疗AI安全中的应用

Anushka Sheoran, Yiduo Hao

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title);AI safety(title);分类 cs.AI

AI总结 提出多轮对抗基准MultiTurnPSB,通过四轮对话评估医疗聊天机器人的安全漏洞,发现多轮攻击下不安全响应率从35%升至近80%,并验证了轻量级输入分类器可降低52个百分点的不安全响应但存在高误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14418 2026-05-15 cs.CR cs.AI 90%

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

伟大的伪装者:大语言模型 jailbreak 中的一个随机性问题

Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

机构 * Core contributors(核心贡献者)

专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI

AI总结 本文研究了大语言模型 jailbreak 中随机性对攻击成功率的影响,提出新的评估和生成框架,发现攻击成功率存在不稳定性且易被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI 90%

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(title);分类 cs.AI

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09542 2026-08-11 cs.LG cs.AI cs.CR 新提交 90%

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解

Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08778 2026-05-12 cs.AI cs.LG cs.MA 90%

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

并非所有转折都重要:多轮 jailbreak 的信用分配

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 TRACE 框架,通过区分多轮 jailbreak 中不同回合的贡献,提升攻击效果和防御安全。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00583 2026-05-04 cs.CV cs.AI cs.LG 90%

Jailbreaking Vision-Language Models Through the Visual Modality

通过视觉模态 jailbreak 视觉-语言模型

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman

机构 * Warsaw University of Technology(华沙理工大学) NASK National Research Institute(波兰国家研究研究院) University of Liverpool(利物浦大学) Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13527 2026-04-27 cs.CL cs.AI 90%

Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression

逻辑突破:通过形式逻辑表达高效解锁LLM安全限制

Jingyu Peng, Maolin Wang, Nan Wang, Jiatong Li, Yuchen Li, Yuyang Ye, Wanyu Wang, Pengyue Jia, Kai Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Rutgers University(罗格斯大学) University of Science and Technology of China(中国科学技术大学) Universiteit van Amsterdam(阿姆斯特丹大学) Baidu Inc(百度公司)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04448 2026-04-07 cs.LG cs.AI cs.CR 90%

RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models

RASA:面向混合专家模型的路由感知安全对齐

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

机构 * Department of XXX, University of YYY(YYY大学XXX系) School of ZZZ, Institute of WWW(WWW学院ZZZ学院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 RASA通过针对性修复安全关键专家提升混合专家模型的安全性,有效防止路由绕过,实现高鲁棒性和跨攻击泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10543 2026-02-02 cs.AI cs.CL 90%

Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing

通过解码过程中的安全意识探测防御大型语言模型的劫持攻击

Yinzhi Zhao, Ming Wang, Shi Feng, Xiaocui Yang, Daling Wang, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过在解码过程中激活内在安全意识,提升大型语言模型对劫持攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏