arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2605.17971 2026-05-19 cs.CR cs.AI 92%

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学) University of Hong Kong(香港大学)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12710 2026-05-19 cs.CL cs.CR 89%

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs

改进方法而非提示:针对大语言模型的进化式 jailbreak 攻击合成

Yunhao Chen, Xin Wang, Juncheng Li, Yixu Wang, Jie Li, Yan Teng, Yingchun Wang, Xingjun Ma

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 越狱攻击 :jailbreak(title,title_cn);red teaming(abstract);分类 cs.CL

AI总结 本文提出 EvoSynth 框架,通过在代码空间中进行搜索,而非仅在提示空间中优化,从而提高对大语言模型的 jailbreak 攻击成功率和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD 85%

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16471 2026-05-19 cs.CR 82%

From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI

从AI生成内容到代理行为:生成式AI中的安全与安全威胁

Zelin Zhang, Qi Li, Jie Cao, Lingshuang Liu, Jianbing Ni

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract)

AI总结 研究探讨生成式AI从内容生成转向执行操作带来的安全与安全威胁,分析攻击者需求、系统自主性及潜在危害的变化,并评估检测、水印、对齐等技术对策,指出当前治理机制无法提供必要的协调。

Comments Accepted by Journal of Information and Intelligence (JII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18239 2026-05-19 cs.CL cs.AI 73%

Multilingual jailbreaking of LLMs using low-resource languages

使用低资源语言对LLM进行多语言劫持

Dylan Marx, Marcel Dunaiski

机构 * Computer Science Division, Mathematical Sciences Department(计算机科学系,数学科学系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究通过使用低资源非洲语言进行多轮对话来测试大型语言模型的安全机制,发现翻译质量是影响低资源语言劫持成功率的关键因素。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17577 2026-05-19 cs.CV 67%

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优

Xin Wang, Yixu Wang, Jiaming Zhang, Ruofan Wang, Jiaqi Yu, Kai Chen, Jingjing Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fellow, IEEE(IEEE会士)

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18150 2026-05-19 cs.AI 57%

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

噪声中的低语:通过多智能体框架引导的代理觉醒

Mengyu Sun, Ziyuan Yang, Zunlong Zhou, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在黑盒约束下如何通过多智能体框架从预训练模型中恢复被擦除的概念,提出了一种无需训练的代理方法,通过引导噪声状态来实现可控的觉醒,展示了当前概念擦除方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18083 2026-05-19 cs.CL 57%

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE

多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展

Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17772 2026-05-19 cs.CV 50%

Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework

通过联合多目标和多模型优化框架实现通用物理对抗攻击

Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

机构 * Research Center for Space Optical Engineering, Harbin Institute of Technology(哈尔滨工业大学空间光学工程研究中心) Zhengzhou Research Institute, Harbin Institute of Technology(郑州研究院,哈尔滨工业大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出了一种联合多目标和多模型优化框架(JMOF),通过定量相似性分析选择最优的替代模型集合,以解决物理对抗攻击中单个替代模型过拟合和优化目标的问题,同时通过双层机制平衡攻击效率与深度泛化,并通过正交梯度对齐策略解决跨模型梯度冲突,从而提升攻击效果和跨任务泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏