arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-18 至 2026-05-18 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2512.06655 2026-05-18 cs.LG cs.AI 86%

Graph-Regularized Sparse Autoencoders for LLM Safety Steering

图正则化稀疏自编码器用于LLM安全引导

Jehyeok Yeon, Federico Cinus, Yifan Wu, Luca Luceri

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Intesa Sanpaolo(Intesa Sanpaolo公司) University of Southern California(南加州大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出图正则化稀疏自编码器,通过在神经元共激活图上平滑解码器向量并应用方向库,提升安全引导效果,在多个基准测试中显著提高有害请求拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15598 2026-05-18 cs.CR cs.SE 80%

Compositional Jailbreaking: An Empirical Analysis of Mutator Chain Interactions in Aligned LLMs

组合式劫持:对齐大语言模型中突变链相互作用的实证分析

Reinelle Jan Bugnot, Soohyeon Choi, Hoon Wei Lim, Yue Duan

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)

AI总结 本文研究了对齐大语言模型中突变链的相互作用,通过十二个基线突变器评估有害提示的组合效果,揭示了突变器间的非均匀交互特性及安全对齐结构的潜在属性。

Comments 16 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02832 2026-05-18 cs.CR cs.AI 79%

FlipAttack: Jailbreak LLMs via Flipping

FlipAttack:通过翻转对大型语言模型进行劫持

Yue Liu, Xiaoxin He, Miao Xiong, Jinlan Fu, Shumin Deng, Yingwei Ma, Jiaheng Zhang, Bryan Hooi

机构 * Engineering Programme, NUS Graduate School, National University of Singapore(国立新加坡大学整合科学与工程计划) Institute of Data Science (IDS), National University of Singapore(国立新加坡大学数据科学研究所) Department of Computer Science, School of Computing, National University of Singapore(国立新加坡大学计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 FlipAttack通过在提示左侧添加噪声,利用语言模型自左向右理解文本的特性,实现对黑盒LLM的高效劫持,实验显示其在多个模型上均表现出高成功率。

Comments 43 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 50%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏