arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2603.12023 2026-03-13 cs.CR cs.AI 77%

Cascade: Composing Software-Hardware Attack Gadgets for Adversarial Threat Amplification in Compound AI Systems

级联:组合软件硬件攻击工具以在复合AI系统中实现对抗性威胁放大

Sarbartha Banerjee, Prateek Sahu, Anjo Vahldiek-Oberwagner, Jose Sanchez Vicarte, Mohit Tiwari

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出通过结合传统软件硬件漏洞与LLM算法攻击,实现复合AI系统中的对抗性威胁放大,展示两种新型攻击方法并系统化分析其组合。

Comments 11 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16765 2026-03-13 cs.CR cs.AI 70%

Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks

明目张胆:一种用于隐蔽大语言模型劫持的隐写术方法

Jianing Geng, Biao Yi, Zekun Fei, Ruiqi He, Lihai Nie, Tong Li, Zheli Liu

机构 * College of Cyber Science, Key Laboratory of DISSec, Nankai University(网络安全学院、DISSec重点实验室、南开大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 StegoAttack通过隐写术在无害段落中嵌入有害查询,实现对大语言模型的高效隐蔽劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏