arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-05 至 2026-05-05 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2605.00974 2026-05-05 cs.CR cs.CL 81%

SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

SRTJ:自演化规则驱动的无训练LLM jailbreaking

Jindong Li, Ying Liu, Yali Fu, Jinjing Zhu, Leyao Wang, Menglin Yang, Rex Ying

机构 * HKUST (GZ)(香港科技大学(广州)) Jilin University(吉林大学) Yale University(耶鲁大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01034 2026-05-05 cs.CL 57%

A Theoretical Game of Attacks via Compositional Skills

通过组合技能的攻击理论游戏

Xinbo Wu, Huan Zhang, Abhishek Umrawal, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出一个理论框架,分析攻击者与防御者之间的博弈,设计最优攻击策略并揭示其与现有对抗提示方法的关系,同时推导出可证明最优的防御策略,并通过实验验证其在不同LLM和基准上的优越性。

Comments arXiv admin note: text overlap with arXiv:2505.20841

详情

展开后加载摘要…

URL PDF HTML 收藏