arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2604.12371 2026-04-16 cs.CV 82%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 越狱攻击 :alignment(title);safety(abstract);prompt injection(abstract)

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14053 2026-04-16 cs.CL 70%

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution

词源何处:通过源归属高效正则化代码分词器

Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov

机构 * CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt(CAIRO应用技术大学(乌尔姆-施维林)) JetBrains Research(JetBrains研究) TU Delft(代尔夫特理工大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过源归属BPE(SA-BPE)正则化方法,解决代码分词器因训练数据不平衡导致的冗余token问题,提升分词效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13308 2026-04-16 cs.CR cs.SY eess.SY 50%

Threat Modeling and Attack Surface Analysis of IoT-Enabled Controlled Environment Agriculture Systems

物联网赋能可控环境农业系统的威胁建模与攻击面分析

Andrii Vakhnovskyi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次提出物联网可控环境农业系统的全面威胁模型,识别123种威胁并提出防御框架,揭示AI驱动农业中的新型攻击类别及物理影响。

Comments 11 pages, 1 figure, 5 tables, 48 references

详情

展开后加载摘要…

URL PDF HTML 收藏