arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2505.21277 2025-05-29 cs.CR cs.AI cs.CL 84%

Breaking the Ceiling: Exploring the Potential of Jailbreak Attacks through Expanding Strategy Space

Yao Huang, Yitong Sun, Shouwei Ruan, Yichi Zhang, Yinpeng Dong, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) College of AI, Tsinghua University(清华大学人工智能学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 20 figures, accepted by ACL 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19883 2025-05-27 cs.CR cs.AI cs.CL 84%

Beyond the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models

Sibo Yi, Tianshuo Cong, Xinlei He, Qi Li, Jiaxing Song

机构 * Tsinghua University(清华大学) Zhongguancun Laboratory(中关村实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shandong Key Laboratory of Artificial Intelligence Security(山东省人工智能安全重点实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00869 2025-05-26 cs.CL cs.AI 84%

Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks

Yue Zhou, Henry Peng Zou, Barbara Di Eugenio, Yang Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to the main conference of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21053 2025-05-01 cs.LG cs.AI 84%

NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models

Yi Zhou, Wenpeng Xing, Dezhang Kong, Changting Lin, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨江研究院) South China University of Technology(华南理工大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08813 2025-04-15 cs.LG cs.AI cs.CR 84%

SafeMLRM: Demystifying Safety in Multi-modal Large Reasoning Models

Junfeng Fang, Yukai Wang, Ruipeng Wang, Zijun Yao, Kun Wang, An Zhang, Xiang Wang, Tat-Seng Chua

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07985 2025-04-08 cs.CL cs.AI 84%

MetaSC: Test-Time Safety Specification Optimization for Language Models

Víctor Gallego

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Published at ICLR 2025 Workshop on Foundation Models in the Wild

Journal ref ICLR 2025 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21598 2025-04-01 cs.CR cs.AI cs.LG 84%

Prompt, Divide, and Conquer: Bypassing Large Language Model Safety Filters via Segmented and Distributed Prompt Processing

Johan Wahréus, Ahmed Hussain, Panos Papadimitratos

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments 22 pages; 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21083 2025-03-07 cs.CL cs.AI 84%

Stealthy Jailbreak Attacks on Large Language Models via Benign Data Mirroring

Honglin Mu, Han He, Yuxin Zhou, Yunlong Feng, Yang Xu, Libo Qin, Xiaoming Shi, Zeming Liu, Xudong Han, Qi Shi, Qingfu Zhu, Wanxiang Che

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14486 2025-02-21 cs.CR cs.AI cs.CL 84%

How Jailbreak Defenses Work and Ensemble? A Mechanistic Investigation

Zhuohang Long, Siyuan Wang, Shujun Liu, Yuhang Lai, Xuanjing Huang, Zhongyu Wei

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02629 2025-02-13 cs.CR cs.AI cs.CL 84%

Layer-Level Self-Exposure and Patch: Affirmative Token Mitigation for Jailbreak Attack Defense

Yang Ouyang, Hengrui Gu, Shuhang Lin, Wenyue Hua, Jie Peng, Bhavya Kailkhura, Meijun Gao, Tianlong Chen, Kaixiong Zhou

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09321 2025-02-05 cs.CR cs.AI cs.CL 84%

JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models

Delong Ran, Jinyuan Liu, Yichen Gong, Jingyi Zheng, Xinlei He, Tianshuo Cong, Anyu Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments This is the Extended Version for the Poster at NDSS Symposium 2025, Feb 24-28, 2025. Our code is available at https://github.com/ThuCCSLab/JailbreakEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11183 2025-01-22 cs.CR cs.AI cs.LG 84%

Can Safety Fine-Tuning Be More Principled? Lessons Learned from Cybersecurity

David Williams-King, Linh Le, Adam Oberman, Yoshua Bengio

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments published at Neurips Safe Generative AI Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11317 2025-01-22 cs.LG cs.CL cs.CR 84%

Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation

Qizhang Li, Xiaochen Yang, Wangmeng Zuo, Yiwen Guo

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03814 2025-01-08 cs.AI cs.CL cs.CR 84%

MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue

Fengxiang Wang, Ranjie Duan, Peng Xiao, Xiaojun Jia, Shiji Zhao, Cheng Wei, YueFeng Chen, Chongwen Wang, Jialing Tao, Hang Su, Jun Zhu, Hui Xue

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02029 2025-01-07 cs.LG cs.AI cs.CR cs.CV 84%

Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models

Ziwei Zheng, Junyao Zhao, Le Yang, Lijun He, Fan Li

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00055 2025-01-03 cs.CR cs.AI cs.CL 84%

LLM-Virus: Evolutionary Jailbreak Attack on Large Language Models

Miao Yu, Junfeng Fang, Yingjie Zhou, Xing Fan, Kun Wang, Shirui Pan, Qingsong Wen

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02632 2024-12-24 cs.CL cs.AI 84%

SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models

Muxi Diao, Rumei Li, Shiyang Liu, Guogang Liao, Jingang Wang, Xunliang Cai, Weiran Xu

专题命中 越狱攻击 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04783 2024-11-15 cs.LG cs.CL cs.CR 84%

AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks

Yifan Zeng, Yiran Wu, Xiao Zhang, Huazheng Wang, Qingyun Wu

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17262 2024-10-31 cs.CL cs.AI 84%

Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue

Zhenhong Zhou, Jiuyang Xiang, Haopeng Chen, Quan Liu, Zherui Li, Sen Su

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments working in progress 23pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10150 2024-10-15 cs.CL cs.AI 84%

Jailbreak Instruction-Tuned LLMs via end-of-sentence MLP Re-weighting

Yifan Luo, Zhennan Zhou, Meitan Wang, Bin Dong

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08424 2024-10-01 cs.CR cs.AI cs.CL 84%

Distract Large Language Models for Automatic Jailbreak Attack

Zeguan Xiao, Yan Yang, Guanhua Chen, Yun Chen

专题命中 越狱攻击 :jailbreak(title,abstract);red teaming(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07503 2024-09-13 cs.CR cs.AI cs.CL 84%

AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs

Lijia Lv, Weigang Zhang, Xuehai Tang, Jie Wen, Feng Liu, Jizhong Han, Songlin Hu

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20775 2024-08-22 cs.CR cs.AI cs.CL cs.MM 84%

Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models

Xijie Huang, Xinyuan Wang, Hantao Zhang, Yinghao Zhu, Jiawen Xi, Jingkun An, Hao Wang, Hao Liang, Chengwei Pan

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09326 2024-08-20 cs.CL cs.AI cs.SE 84%

Characterizing and Evaluating the Reliability of LLMs against Jailbreak Attacks

Kexin Chen, Yi Liu, Dongxia Wang, Jiaying Chen, Wenhai Wang

专题命中 越狱攻击 :jailbreak(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10753 2024-08-19 cs.CL cs.AI 84%

ToolSword: Unveiling Safety Issues of Large Language Models in Tool Learning Across Three Stages

Junjie Ye, Sixian Li, Guanyu Li, Caishuang Huang, Songyang Gao, Yilong Wu, Qi Zhang, Tao Gui, Xuanjing Huang

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 Main Conference

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics 2024 (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03045 2024-07-04 cs.HC cs.CL cs.LG 84%

JailbreakHunter: A Visual Analytics Approach for Jailbreak Prompts Discovery from Large-Scale Human-LLM Conversational Datasets

Zhihua Jin, Shiyi Liu, Haotian Li, Xun Zhao, Huamin Qu

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18122 2024-06-27 cs.CL cs.AI 84%

Poisoned LangChain: Jailbreak LLMs by LangChain

Ziqiu Wang, Jun Liu, Shengkai Zhang, Yang Yang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 6 pages,2 figures,This paper is a submission to ACM TURC. It has been accepted by the editor of the organizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10630 2024-06-18 cs.CL cs.AI cs.CR cs.MA 84%

Emerging Safety Attack and Defense in Federated Instruction Tuning of Large Language Models

Rui Ye, Jingyi Chai, Xiangrui Liu, Yaodong Yang, Yanfeng Wang, Siheng Chen

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08567 2024-06-04 cs.CL cs.CR cs.CV cs.LG cs.MA 84%

Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast

Xiangming Gu, Xiaosen Zheng, Tianyu Pang, Chao Du, Qian Liu, Ye Wang, Jing Jiang, Min Lin

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04451 2024-03-22 cs.CL cs.AI 84%

AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Xiaogeng Liu, Nan Xu, Muhao Chen, Chaowei Xiao

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments Published as a conference paper at ICLR 2024. Code is available at https://github.com/SheltonLiu-N/AutoDAN

详情

展开后加载摘要…

URL PDF HTML 收藏