arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2508.09190 2026-02-02 cs.LG cs.AI 86%

Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining

多级安全连续投影:无需重新训练的微调大语言模型安全增强方法

Bing Han, Feifei Zhao, Dongcheng Zhao, Guobin Shen, Ping Wu, Yu Shi, Yi Zeng

机构 * Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知人工智能实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需重新训练的微调后安全增强方法MSCP,通过多级表示对齐和安全方向投影,有效抑制有害输出并提升与人类偏好的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15304 2026-01-19 cs.CL cs.AI 86%

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

对抗性诗歌作为大型语言模型中的通用单轮绕过机制

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Marcello Galisai, Vincenzo Suriani, Olga Sorokoletova, Federico Sartore, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马Sapienza大学) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校) VU Amsterdam(阿姆斯特丹VU)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 对抗性诗歌被证明能有效绕过大型语言模型的安全机制,其攻击成功率显著高于传统方法,揭示了现有安全措施的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS 86%

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03600 2026-01-08 cs.LG cs.AI cs.IR 86%

ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification

ALERT: 通过内部不一致放大实现零样本LLM jailbreak检测

Xiao Lin, Philip Li, Zhichen Zeng, Tingwei Li, Tianxin Wei, Xuying Ning, Gaotang Li, Yuzhong Chen, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Visa

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 ALERT通过内部不一致放大技术实现零样本LLM jailbreak检测,有效提升安全检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24044 2026-01-01 cs.CR cs.AI cs.CL 86%

Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?

对抗攻击与内容安全过滤:我们在LLM安全竞赛中走了多远?

Yuan Xin, Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Southern University of Science and Technology(南方科技大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文系统评估了针对LLM安全对齐的劫持攻击,发现大多数攻击可被安全过滤器检测到,同时指出需优化召回率和精确度以提升安全系统性能。

Comments 26 pages,11 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15289 2025-11-25 cs.CR cs.AI cs.CL 86%

SATA: A Paradigm for LLM Jailbreak via Simple Assistive Task Linkage

SATA: 一种通过简单辅助任务链接实现LLM劫持的范式

Xiaoning Dong, Wenbo Hu, Wei Xu, Tianxing He

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Hefei University of Technology(合肥工业大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 SATA通过简单辅助任务链接实现LLM劫持,有效绕过安全措施并提升攻击成功率

Comments ACL Findings 2025. Welcome to employ SATA as a baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14250 2025-11-14 cs.CL cs.AI cs.CR 86%

Siren: A Learning-Based Multi-Turn Attack Framework for Simulating Real-World Human Jailbreak Behaviors

Yi Zhao, Youzhi Zhang

机构 * Department of Computing The Hong Kong Polytechnic University Hong Kong SAR, China Centre for Artificial Intelligence Robotics Hong Kong Institute of Science \& Innovation Chinese Academy of Sciences Hong Kong SAR, China

专题命中 越狱攻击 :jailbreak(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACSAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19775 2025-09-25 cs.CL cs.AI cs.CR 86%

bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs

Wence Ji, Jiancan Wu, Aiying Li, Shuyi Zhang, Junkang Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13946 2025-06-05 cs.CL cs.AI cs.CR 86%

Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region

Chak Tou Leong, Qingyu Yin, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03869 2025-06-04 cs.CL cs.AI cs.CR cs.CV cs.MM 86%

Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step

Wenxuan Wang, Kuiyi Gao, Youliang Yuan, Jen-tse Huang, Qiuzhi Liu, Shuai Wang, Wenxiang Jiao, Zhaopeng Tu

机构 * Renmin University of China(中国人民大学) Chinese University of Hong Kong(香港大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Johns Hopkins University(约翰霍普金斯大学) Tencent(腾讯) Hong Kong University of Science and Technology(香港科技大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12287 2025-05-20 cs.CL cs.AI 86%

The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models

Linghan Huang, Haolin Jin, Zhaoge Bi, Pengyue Yang, Peizhou Zhao, Taozhao Chen, Xiongfei Wu, Lei Ma, Huaming Chen

机构 * School of Electrical and Computer Engineering, University of Sydney(电子与计算机工程学院,悉尼大学) The University of Tokyo, Japan(东京大学,日本)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10694 2025-04-16 cs.LG cs.AI cs.CR 86%

The Jailbreak Tax: How Useful are Your Jailbreak Outputs?

Kristina Nikolić, Luze Sun, Jie Zhang, Florian Tramèr

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17932 2025-03-25 cs.CL cs.AI cs.CR 86%

STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models

Xunguang Wang, Wenxuan Wang, Zhenlan Ji, Zongjie Li, Pingchuan Ma, Daoyuan Wu, Shuai Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11054 2025-03-12 cs.CL cs.AI cs.CR 86%

Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models

Zonghao Ying, Deyue Zhang, Zonglei Jing, Yisong Xiao, Quanchen Zou, Aishan Liu, Siyuan Liang, Xiangzheng Zhang, Xianglong Liu, Dacheng Tao

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01902 2025-03-04 cs.CR cs.AI cs.CL 86%

SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters

Yan Yang, Zeguan Xiao, Xin Lu, Hongru Wang, Xuetao Wei, Hailiang Huang, Guanhua Chen, Yun Chen

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13095 2025-02-19 cs.CV cs.CL cs.LG 86%

Understanding and Rectifying Safety Perception Distortion in VLMs

Xiaohan Zou, Jian Kang, George Kesidis, Lu Lin

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11379 2025-02-18 cs.CR cs.AI cs.CL 86%

CCJA: Context-Coherent Jailbreak Attack for Aligned Large Language Models

Guanghao Zhou, Panjia Qiu, Mingyuan Fan, Cen Chen, Mingyuan Chu, Xin Zhang, Jun Zhou

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01547 2024-12-03 cs.CR cs.AI cs.LG 86%

Improved Large Language Model Jailbreak Detection via Pretrained Embeddings

Erick Galinkin, Martin Sablotny

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

Comments Submitted to AICS 2025: https://aics.site

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11533 2024-10-22 cs.CL cs.AI 86%

Multi-round jailbreak attack on large language models

Yihua Zhou, Xiaochuan Shi

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments It is not fully completed

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12344 2024-07-18 cs.CL cs.CY 86%

The Better Angels of Machine Personality: How Personality Relates to LLM Safety

Jie Zhang, Dongrui Liu, Chen Qian, Ziyue Gan, Yong Liu, Yu Qiao, Jing Shao

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11753 2024-06-10 cs.CL cs.AI 86%

ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs

Fengqing Jiang, Zhangchen Xu, Luyao Niu, Zhen Xiang, Bhaskar Ramasubramanian, Bo Li, Radha Poovendran

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments To appear in ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06899 2024-05-31 cs.CL cs.AI 86%

Flames: Benchmarking Value Alignment of LLMs in Chinese

Kexin Huang, Xiangyang Liu, Qianyu Guo, Tianxiang Sun, Jiawei Sun, Yaru Wang, Zeyang Zhou, Yixu Wang, Yan Teng, Xipeng Qiu, Yingchun Wang, Dahua Lin

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

Comments Accepted to the NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05915 2024-04-02 cs.CL cs.AI 86%

Fake Alignment: Are LLMs Really Aligned Well?

Yixu Wang, Yan Teng, Kexin Huang, Chengqi Lyu, Songyang Zhang, Wenwei Zhang, Xingjun Ma, Yu-Gang Jiang, Yu Qiao, Yingchun Wang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted to the NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15180 2024-02-28 cs.LG cs.CL cs.CR 86%

Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement

Heegyu Kim, Sehyun Yuk, Hyunsouk Cho

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13213 2023-08-21 cs.CR cs.CL cs.LG 86%

Visual Adversarial Examples Jailbreak Aligned Large Language Models

Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09095 2026-08-11 cs.AI 新提交 85%

Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

谁搭建安全桥梁?识别并靶向跨语言共享安全路径

Shuyi Miao, Wangjie Qiu, Pengyang Shao, Canran Xiao, Fei Shen, Zhiming Zheng, Tat-Seng Chua

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 85%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新 85%

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract_cn);分类 cs.AI

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12406 2026-07-15 cs.AI 新提交 85%

Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions

隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南政法大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19274 2026-07-14 cs.CL 版本更新 85%

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

HarDBench: 面向安全人机协作写作的基于草稿的合著越狱攻击基准

Euntae Kim, Soomin Han, Buru Chang

机构 * Korea University(韩国大学) Sogang University(ソガン大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出HarDBench基准,评估大语言模型在协作写作中面对恶意草稿填充的越狱攻击的鲁棒性,并通过偏好优化实现安全-效用平衡的对齐方法。

Comments ACL 2026 Main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 40785-40831 July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏