arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-09 至 2026-06-09 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2606.07706 2026-06-09 cs.CR cs.AI 新提交 85%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17231 2026-06-09 cs.CL cs.CR 版本更新 85%

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

通过从大语言模型到小语言模型的对抗性提示蒸馏实现高效且隐蔽的越狱攻击

Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学) University of Liverpool(利物浦大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出对抗性提示蒸馏(APD)框架,将LLM的越狱能力迁移到SLM,实现高效低资源攻击,在GPT-4上达到96.4%攻击成功率,速度提升3.7倍,参数减少11.3倍。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03226 2026-06-09 cs.LG cs.AI cs.CR 版本更新 84%

Self-Mined Hardness for Safety Fine-Tuning

自我挖掘的难度用于安全微调

Prakhar Gupta, Garv Shah, Donghua Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07970 2026-06-09 cs.CL cs.AI 新提交 73%

Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

通过扩展训练时对抗攻击防御恶意微调

Haoming Wen, Shi Chen, Qingyu Shi, Siyuan Liu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17947 2026-06-09 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 67%

PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits

PLAGUE:面向多轮利用的终身自适应生成的即插即用框架

Neeladri Bhuiya, Madhav Aggarwal, Diptanshu Purwar

机构 * A10 Networks, Inc.(A10网络公司) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PLAGUE框架,通过终身学习启发的三阶段设计(Primer、Planner、Finisher)实现高效多轮越狱攻击,在o3和Opus 4.1等强安全模型上ASR提升超30%。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16346 2026-06-09 cs.CL cs.LG 版本更新 62%

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

有益于故障:测量多轮、多语言LLM代理中的非法协助

Nivya Talokar, Ayush K Tarun, Murari Mandal, Maksym Andriushchenko, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院) independent(独立研究员) tubingen(图宾根大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STING框架,用于评估多轮多语言LLM代理在执行非法任务时的协助能力,发现低资源语言中攻击成功率不一致,提供实际部署中的压力测试方法。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 57%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 57%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04633 2026-06-09 cs.HC cs.CY cs.RO 57%

"Can you be my mum?": Manipulating Social Robots in the Large Language Models Era

你能做我的妈妈吗?:在大型语言模型时代操纵社交机器人

Giulio Antonio Abbo, Gloria Desideri, Tony Belpaeme, Micol Spitale

机构 * IDLab-AIRO , Ghent University – imec(IDLab-AIRO 和根特大学-imec) DEIB , Politecnico di Milano(DEIB 和米兰理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 研究探讨了在大型语言模型时代,用户如何利用机器人违反伦理原则,通过三种场景测试发现五种操纵技术,旨在为设计更安全的伦理人机交互提供参考。

Comments 10 pages, 2 figures

Journal ref HRI '25: Proceedings of the 2025 ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏