arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2509.11141 2025-09-16 cs.CL 70%

When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity

Shiyao Cui, Xijia Feng, Yingkang Wang, Junxiao Yang, Zhexin Zhang, Biplab Sikdar, Hongning Wang, Han Qiu, Minlie Huang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05471 2025-09-09 cs.CR cs.AI 70%

Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models

Youjia Zheng, Mohammad Zandsalimy, Shanu Sushmita

机构 * Northeastern University(东北大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13341 2025-09-08 cs.LG cs.CR 70%

Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing

Keltin Grimes, Marco Christiani, David Shriver, Marissa Connor

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19292 2025-08-28 cs.CR cs.AI 70%

Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience

Xi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Bin Ji, Jun Ma, Xiaodong Liu, Jing Wang, Feilong Bao, Jianfeng Zhang, Baosheng Wang, Jie Yu

机构 * National University of Defense and Technology(国防科技大学) Inner Mongolia University(内蒙古大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 18 pages, EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12072 2025-08-26 cs.CR cs.CL 70%

Mitigating Jailbreaks with Intent-Aware LLMs

Wei Jie Yeo, Ranjan Satapathy, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学) Institute of High Performance Computing(高性能计算研究所) Agency for Science, Technology and Research(科技研究局)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16484 2025-08-25 cs.CL 70%

HAMSA: Hijacking Aligned Compact Models via Stealthy Automation

Alexey Krylov, Iskander Vagizov, Dmitrii Korzh, Maryam Douiba, Azidine Guezzaz, Vladimir Kokh, Sergey D. Erokhin, Elena V. Tutubalina, Oleg Y. Rogov

机构 * MIPT(莫斯科国立信息安全学院) Sberbank(俄罗斯储蓄银行) AIRI(人工智能研究机构) MTUCI(莫斯科联邦大学) ISP RAS(俄罗斯科学院信息与通信技术研究所) Cadi Ayyad University(卡迪·艾亚德大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments 9 pages, 1 figure; article under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09218 2025-08-14 cs.CV cs.AI 70%

Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity

Zuoou Li, Weitong Zhang, Jingyuan Wang, Shuyuan Zhang, Wenjia Bai, Bernhard Kainz, Mengyun Qiao

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07139 2025-08-12 cs.CR cs.AI 70%

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection

Ivan Zhang

机构 * CMU(卡内基梅隆大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01306 2025-08-05 cs.AI cs.CR 70%

PUZZLED: Jailbreaking LLMs through Word-Based Puzzles

Yelim Ahn, Jaejin Lee

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22037 2025-07-30 cs.CR cs.AI 70%

Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security

Muzhi Dai, Shixuan Liu, Zhiyuan Zhao, Junyu Gao, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) Northwestern Polytechnical University(西北工业大学) China Telecom, China(中国电信,中国)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21182 2025-07-30 cs.CR cs.AI 70%

SDD: Self-Degraded Defense against Malicious Fine-tuning

Zixuan Chen, Weikai Lu, Xin Lin, Ziqian Zeng

机构 * Zixuan Chen(陈子轩) Weikai Lu(卢伟凯) Xin Lin(林鑫) Ziqian Zeng(曾子谦)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Accepted by ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17256 2025-07-25 cs.CL 70%

Weak-to-Strong Jailbreaking on Large Language Models

Xuandong Zhao, Xianjun Yang, Tianyu Pang, Chao Du, Lei Li, Yu-Xiang Wang, William Yang Wang

机构 * Sea AI Lab, Singapore(新加坡海智实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00718 2025-07-11 cs.LG cs.SD eess.AS 70%

"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models

Isha Gupta, David Khachaturov, Robert Mullins

机构 * ETH Zürich(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03236 2025-07-10 cs.CR cs.AI 70%

On Jailbreaking Quantized Language Models Through Fault Injection Attacks

Noureldin Zahran, Ahmad Tahmasivand, Ihsen Alouani, Khaled Khasawneh, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence Solutions(人工智能解决方案公司) Electrical and Computer Engineering Department, George Mason University(乔治·马歇尔大学电气与计算机工程系) School of Electronics, Electrical Engineering and Computer Sciences, Queen’s University Belfast(女王大学贝尔法斯特电子、电气与计算机科学学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

Comments This work has been published in GLSVLSI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02956 2025-07-08 cs.CR cs.AI 70%

A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks

Blake Bullwinkel, Mark Russinovich, Ahmed Salem, Santiago Zanella-Beguelin, Daniel Jones, Giorgio Severi, Eugenia Kim, Keegan Hines, Amanda Minnich, Yonatan Zunger, Ram Shankar Siva Kumar

机构 * msft(微软)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16369 2025-07-03 cs.CL 70%

Don't Say No: Jailbreaking LLM by Suppressing Refusal

Yukai Zhou, Jian Lou, Zhijie Huang, Zhan Qin, Yibei Yang, Wenjie Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23576 2025-07-01 cs.AI 70%

Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models

Maria Carolina Cornelia Wit, Jun Pang

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

Comments 26 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14539 2025-06-27 cs.AI cs.CR 70%

Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack

Daewon Kang, YeongHwan Shin, Doyeon Kim, Kyu-Hwan Jung, Meong Hi Son

机构 * Research Institute for Future Medicine, Samsung Medical Center(未来医学研究所,三星医疗中心) Department of Digital Health, SAIHST, Sungkyunkwan University(数字健康系,SAIHST,成均馆大学) Department of Medical Device Management and Research, SAIHST, Sungkyunkwan University(医疗设备管理与研究系,SAIHST,成均馆大学) Department of Emergency Medicine, Samsung Medical Center(急诊医学系,三星医疗中心)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12685 2025-06-17 cs.CR cs.AI 70%

Alphabet Index Mapping: Jailbreaking LLMs through Semantic Dissimilarity

Bilal Saleh Husain

机构 * Department of Mathematics University of Toronto(数学系多伦多大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10949 2025-06-17 cs.CR cs.AI 70%

Monitoring Decomposition Attacks in LLMs with Lightweight Sequential Monitors

Chen Yueh-Han, Nitish Joshi, Yulin Chen, Maksym Andriushchenko, Rico Angell, He He

机构 * New York University(纽约大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07596 2025-06-10 cs.LG 70%

TwinBreak: Jailbreaking LLM Security Alignments based on Twin Prompts

Torsten Krauß, Hamid Dashtbani, Alexandra Dmitrienko

机构 * University of Würzburg(乌尔姆大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.LG

Comments 26 pages, 25 tables, 13 figures, 2 algorithms, to appear in the 43th USENIX Security Symposium (USENIX Security 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24019 2025-06-02 cs.CR cs.AI 70%

LLM Agents Should Employ Security Principles

Kaiyuan Zhang, Zian Su, Pin-Yu Chen, Elisa Bertino, Xiangyu Zhang, Ninghui Li

专题命中 越狱攻击 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21967 2025-05-29 cs.CL 70%

Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack

Juan Ren, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22663 2025-05-27 cs.SE cs.CL cs.CR 70%

Automated Trustworthiness Oracle Generation for Machine Learning Text Classifiers

Lam Nguyen Tung, Steven Cho, Xiaoning Du, Neelofar Neelofar, Valerio Terragni, Stefano Ruberto, Aldeida Aleti

机构 * Monash University(莫纳什大学) University of Auckland(奥克兰大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院) Joint Research Centre at the European Commission(欧洲委员会联合研究中心)

专题命中 越狱攻击 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 24 pages, 5 tables, 9 figures, Camera-ready version accepted to FSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16559 2025-05-23 cs.CR cs.CL 70%

CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning

Biao Yi, Tiansheng Huang, Baolei Zhang, Tong Li, Lihai Nie, Zheli Liu, Li Shen

机构 * College of Cyber Science, Nankai University(南开大学网络科学学院) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12931 2025-05-21 cs.CR cs.AI 70%

MirrorShield: Towards Universal Defense Against Jailbreaks via Entropy-Guided Mirror Crafting

Rui Pu, Chaozhuo Li, Rui Ha, Litian Zhang, Lirong Qiu, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09191 2025-04-15 cs.CL 70%

Feature-Aware Malicious Output Detection and Mitigation

Weilong Dong, Peiguang Li, Yu Tian, Xinyi Zeng, Fengdi Li, Sirui Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05689 2025-04-09 cs.CL cs.CR 70%

Separator Injection Attack: Uncovering Dialogue Biases in Large Language Models Caused by Role Separators

Xitao Li, Haijun Wang, Jiang Wu, Ting Liu

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11313 2025-04-03 cs.AI 70%

An Optimizable Suffix Is Worth A Thousand Templates: Efficient Black-box Jailbreaking without Affirmative Phrases via LLM as Optimizer

Weipeng Jiang, Zhenting Wang, Juan Zhai, Shiqing Ma, Zhengyu Zhao, Chao Shen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

Comments Be accepeted as NAACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23250 2025-04-01 cs.CR cs.AI 70%

Encrypted Prompt: Securing LLM Applications Against Unauthorized Actions

Shih-Han Chan

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏