arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2509.25843 2026-04-15 cs.AI 77%

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

ASGuard:激活-缩放防护:缓解针对性劫持攻击

Yein Park, Jungwoo Park, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。

Comments ICLR 2026, 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12817 2026-04-15 cs.LG cs.CR stat.ML 70%

Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory

通过上下文学习理论理解并改进LLMs的连续对抗训练

Shaopeng Fu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.LG

AI总结 本文基于上下文学习理论,首次对LLMs的连续对抗训练进行了理论分析,提出通过引入奇异值正则化项提升对抗训练的鲁棒性与实用性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12359 2026-04-15 cs.CR cs.CL 70%

Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors

通过空空间约束将激活转向编译为权重以实现隐蔽后门

Rui Yin, Tianxu Han, Naen Xu, Changjiang Li, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Palo Alto Networks(帕洛阿尔托网络) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过将后门目标从表面标记转向内部表示,提出一种高效方法,利用空空间约束在触发时激活后门,同时保持隐蔽性和安全性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG 57%

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏