arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2604.10403 2026-04-14 cs.LG 83%

Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs

潜在指令表示对齐:防御对抗性指令、后门和不期望知识在大语言模型中的攻击

Eric Easley, Sebastian Farquhar

机构 * ML Alignment & Theory Scholars(机器学习对齐与理论学者)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出LIRA方法,通过改变模型对指令的解释方式提升泛化能力,并通过内部对抗训练算法进一步增强泛化,有效防御了99%以上的PEZ对抗攻击,移除了一个具有挑战性的不安全代码后门,并在WMDP网络中实现最优遗忘。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10299 2026-04-14 cs.CV cs.CL 83%

Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking

见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全

Jingru Li, Wei Ren, Tianqing Zhu

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) City University of Macau(澳门城市大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。

Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 83%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10326 2026-04-14 cs.CR cs.AI 77%

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

矩阵劫持:用于受控模型反制的空域操控

Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出HMNS方法,通过识别并抑制注意力头,注入受限于正交补集的扰动,实现对模型的受控反制,展示了新的安全防御范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11309 2026-04-14 cs.CR cs.AI cs.CL cs.CV cs.LG 75%

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

切肉威胁:在LLM系统中利用累积风险

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance(字节跳动) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09750 2026-04-14 cs.CR cs.AI 70%

Conflicts Make Large Reasoning Models Vulnerable to Attacks

冲突使大型推理模型容易受到攻击

Honghao Liu, Chengjin Xu, Xuhui Jiang, Cehao Yang, Shengming Yin, Zhengwu Ma, Lionel Ni, Jian Guo

机构 * International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The City University of Hong Kong(香港城市大学) DataArc Tech

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨了冲突如何影响大型推理模型的安全性,发现冲突显著增加攻击成功率,揭示了安全表示在冲突下的变化,强调需更深入的对齐策略以确保模型的鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06840 2026-04-14 cs.CR 50%

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning

MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击

Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏