arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-08 至 2026-04-08 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2604.04992 2026-04-08 cs.CR cs.AI 89%

FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment

FreakOut-LLM:情绪刺激对安全对齐的影响

Daniel Kuznetsov, Ofir Cohen, Karin Shistik, Rami Puzis, Asaf Shabtai

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究探讨情绪刺激是否影响大语言模型的安全对齐,通过实验发现压力情境显著增加逃逸成功率,而放松情境无显著影响,揭示情绪状态对AI攻击的可测量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04951 2026-04-08 cs.CR cs.AI 57%

Synthetic Trust Attacks: Modeling How Generative AI Manipulates Human Decisions in Social Engineering Fraud

合成信任攻击:生成式AI如何操纵人类在社会工程欺诈中的决策

Muhammad Tahir Ashraf

机构 * AAAI Pakistan Chapter(AAAI巴基斯坦分会) PureDesigners Ltd.(PureDesigners有限公司) IBM Watson

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出合成信任攻击(STA)作为正式威胁类别,引入STAM模型,涵盖从敌手侦察到事后利用的完整攻击链,探讨人类决策层的防御策略。

Comments 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 57%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07291 2026-04-08 cs.CR 50%

Evaluating LLM-based Personal Information Extraction and Countermeasures

评估基于大语言模型的个人信息提取及应对措施

Yupei Liu, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究评估了基于大语言模型的个人信息提取技术及防御策略,通过系统测量研究对比了多种方法的性能,发现大语言模型在提取个人信息上表现优异,但通过提示注入可有效防御其攻击。

Comments USENIX Security Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏