arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-27 至 2026-04-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2506.17299 2026-04-27 cs.CR cs.AI cs.LG 93%

Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem

迈向原则化的LLM安全测试:解决 Jailbreak 或acle 问题

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出解决Jailbreak oracle问题的Boa系统,通过分阶段搜索策略评估大语言模型的安全性,实现系统化的防御评估和模型认证。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13527 2026-04-27 cs.CL cs.AI 90%

Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression

逻辑突破:通过形式逻辑表达高效解锁LLM安全限制

Jingyu Peng, Maolin Wang, Nan Wang, Jiatong Li, Yuchen Li, Yuyang Ye, Wanyu Wang, Pengyue Jia, Kai Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Rutgers University(罗格斯大学) University of Science and Technology of China(中国科学技术大学) Universiteit van Amsterdam(阿姆斯特丹大学) Baidu Inc(百度公司)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11157 2026-04-27 cs.CL 90%

Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety

基于响应的知识蒸馏用于多语言对抗预防无意中削弱了安全性

Max Zhang, Derek Liu, Kai Zhang, Joshua Franco, Haihao Liu

机构 * OpenAI Meta

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了基于响应的知识蒸馏在多语言对抗预防中的应用,发现标准微调会增加学生模型的对抗成功率,但去除边界拒绝可缓解安全性下降。

Comments 9 pages, Poster presented at Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 73%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏