arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2510.20956 2026-04-30 cs.CR cs.CL 86%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10998 2026-04-30 cs.CR cs.CL 70%

SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models

SCOUT:一种对抗微调语言模型数据中毒攻击的防御方法

Mohamed Afane, Abhishek Satyam, Ke Chen, Tao Li, Junaid Farooq, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Electrical Engineering, Zhejiang University(浙江大学电子工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出SCOUT框架,通过令牌级显著性分析检测数据中毒攻击,有效识别隐含触发器,提升对复杂攻击的防御能力。

Comments 9 pages, 3 figures

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏