arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2605.10067 2026-05-22 cs.LG cs.AI 89%

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis: 通过自进化元认知策略优化学习 jailbreak LLMs

Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);red teaming(abstract)

AI总结 本文提出Metis框架,通过将jailbreaking重新表述为对抗性部分可观测马尔可夫决策过程中的推理时间策略优化,以提高对抗性测试的效率和效果,同时通过结构化反馈和透明推理轨迹提升可解释性,实验表明Metis在多种模型上均表现出更高的攻击成功率和更低的token成本。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21541 2026-05-22 cs.CR cs.AI cs.LG stat.ML 81%

Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击

Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21674 2026-05-22 cs.CR 67%

Adversarial Reframing: A Framework for Targeted Generation in Language Models

对抗性重构:一种用于语言模型针对性生成的框架

Shahnewaz Karim Sakib, Swati Kar, Anindya Bijoy Das

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出THREAT框架,通过协调多个语言模型进行迭代搜索,寻找文本劫持提示,并通过非凸优化问题解决提示发现问题,提高了攻击成功率并降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏