arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-08 至 2026-06-08 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2606.07335 2026-06-08 cs.CR 新提交 85%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14194 2026-06-08 cs.CL 版本更新 83%

GradShield: Alignment Preserving Finetuning

GradShield: 保持对齐的微调

Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) HUMAIN King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) University of Washington, Seattle(华盛顿大学(西雅图))

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06529 2026-06-08 cs.AI cs.LG 新提交 81%

Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety

智能体AI控制评估中的攻击选择显著降低安全性

Catherine Ge-Wang, Tyler Crosse, Benjamin Hadad, Joachim Schaeffer, Ram Potham, Tyler Tracy

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究攻击者策略性选择攻击时机对AI控制安全性的影响,通过分解攻击决策为开始和停止策略,实验表明两者均显著降低安全性,现有评估可能高估安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21706 2026-06-08 cs.AI 版本更新 77%

Latent-space Attacks for Refusal Evasion in Language Models

潜在空间攻击用于语言模型的拒绝规避

Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) University of Genova(热那亚大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 本文研究了如何通过潜在空间攻击来规避语言模型的拒绝行为,提出了一种受控的潜在空间攻击方法,以提高攻击成功率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15125 2026-06-08 cs.CR 版本更新 50%

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

从存储到操控:针对LLM代理的内存控制流攻击

Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue, Yiliao Song

专题命中 越狱攻击 :safety(abstract)

AI总结 本文研究了内存控制流攻击对LLM代理的影响,提出MEMFLOW框架以系统识别和量化此类攻击,发现超过90%的测试在严格安全约束下仍易受攻击,揭示了严重的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏