arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

2026-07-08 至 2026-07-08 共收录 1
2607.02714 2026-07-08 cs.CR cs.AI 新提交

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale

并非所有拒绝都是等同的:安全对齐如何在大规模情况下使网络安全失败

Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

机构 * Cracken AI

AI总结 研究安全对齐在网络安全领域的问题,通过对24个开源语言模型的实验,以Kimi K2为例展示特定领域删减可行,探讨模型特征与删减效果的关联并分类模型,提出相关猜想。

Comments 14 pages, 11 figures. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏