arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2603.27332 2026-03-31 cs.CV 78%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 越狱攻击 :safety(title,abstract)

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11211 2026-02-13 cs.CR 78%

TRACE: Timely Retrieval and Alignment for Cybersecurity Knowledge Graph Construction and Expansion

TRACE: 信息安全知识图谱构建与扩展中的及时检索与对齐

Zijing Xu, Ziwei Ning, Tiancheng Hu, Jianwei Zhuge, Yangyang Wang, Jiahao Cao, Mingwei Xu

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 TRACE通过整合结构化和非结构化数据,利用LLMs提升网络安全知识图谱的实时更新与实体对齐效率,实现节点覆盖和提取精度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11195 2026-02-10 cs.CR 78%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 越狱攻击 :safety(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 78%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11938 2025-12-30 cs.CL cs.AI cs.LG 78%

Improving Large Language Model Safety with Contrastive Representation Learning

通过对比表征学习提升大语言模型安全性

Samuel Simko, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统最大计划) University of Toronto(多伦多大学)

专题命中 越狱攻击 :safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于对比表征学习的框架,通过三元组损失和对抗性难负样本挖掘提升大语言模型对对抗攻击的鲁棒性。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17874 2025-12-17 cs.CR 78%

Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries

超越劫持:揭示LLM应用中因能力边界模糊而产生的风险

Yunyi Zhang, Shibo Cui, Baojun Liu, Jingkai Yu, Min Zhang, Fan Shi, Han Zheng

专题命中 越狱攻击 :jailbreak(title,abstract)

AI总结 本文研究了LLM应用中因能力边界模糊导致的能力降级和升级风险,提出评估框架并揭示了应用安全性的关键影响因素。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09321 2025-12-16 cs.CR 78%

ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data

ObliInjection: 面向多源数据LLM代理的顺序无关提示注入攻击

Reachal Wang, Yuqi Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(title,abstract)

AI总结 ObliInjection是一种针对多源数据LLM代理的新型提示注入攻击,通过顺序无关损失和顺序GCG算法有效污染输入数据以误导模型执行攻击者指定任务。

Comments To appear in NDSS 2026. For slides, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06387 2025-12-09 cs.CR cs.RO 78%

Beyond Model Jailbreak: Systematic Dissection of the "Ten DeadlySins" in Embodied Intelligence

超越模型劫持:具身智能中的“十大致命罪恶”系统性分析

Yuhang Huang, Junchao Li, Boyang Ma, Xuelong Dai, Minghui Xu, Kaidi Xu, Yue Zhang, Jianping Wang, Xiuzhen Cheng

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :jailbreak(title);safety(abstract)

AI总结 本研究首次系统分析了具身智能平台的十大安全漏洞,揭示了跨层安全弱点,提出了构建稳健具身系统的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18581 2025-11-27 cs.CR 78%

TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization

TASO:通过替代模板和后缀优化实现对抗性攻击

Yanting Wang, Runpeng Geng, Jinghui Chen, Minhao Cheng, Jinyuan Jia

专题命中 越狱攻击 :jailbreak(title,abstract)

AI总结 TASO通过交替优化模板和后缀,提高对抗性攻击的有效性,针对多种大语言模型进行测试并证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19793 2025-08-26 cs.CR 78%

Prompt Injection Attack to Tool Selection in LLM Agents

Jiawen Shi, Zenghui Yuan, Guiyao Tie, Pan Zhou, Neil Zhenqiang Gong, Lichao Sun

专题命中 越狱攻击 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00459 2025-08-05 cs.CR 78%

Defense Against Prompt Injection Attack by Leveraging Attack Techniques

Yulin Chen, Haoran Li, Zihao Zheng, Yangqiu Song, Dekai Wu, Bryan Hooi

专题命中 越狱攻击 :prompt injection(title,abstract)

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15170 2025-08-04 cs.CR 78%

From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem

Yanxu Mao, Tiehan Cui, Peipei Liu, Datao You, Hongsong Zhu

专题命中 越狱攻击 :jailbreak(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13038 2025-07-18 cs.CR 78%

MAD-Spear: A Conformity-Driven Prompt Injection Attack on Multi-Agent Debate Systems

Yu Cui, Hongyang Du

专题命中 越狱攻击 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19041 2025-05-29 cs.CR 78%

Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs

Shiyu Xiang, Ansen Zhang, Yanfei Cao, Yang Fan, Ronghao Chen

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments 16 pages, 12 figures, ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21494 2025-05-28 cs.CV 78%

Adversarial Attacks against Closed-Source MLLMs via Feature Optimal Alignment

Xiaojun Jia, Sensen Gao, Simeng Qin, Tianyu Pang, Chao Du, Yihao Huang, Xinfeng Li, Yiming Li, Bo Li, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) MBZUAI, United Arab Emirates(马克斯·普朗克人工智能研究所,阿拉伯联合酋长国) Sea AI Lab, Singapore(海思人工智能实验室,新加坡) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 越狱攻击 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01565 2025-05-22 cs.CR 78%

SQL Injection Jailbreak: A Structural Disaster of Large Language Models

Jiawei Zhao, Kejiang Chen, Weiming Zhang, Nenghai Yu

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments Accepted by findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15854 2025-05-19 eess.SY cs.SY 78%

A Modular Safety Filter for Safety-Certified Cyber-Physical Systems

Mohammad Bajelani, Mehran Attar, Walter Lucia, Klaske van Heusden

专题命中 越狱攻击 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11114 2025-04-25 cs.CR 78%

JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit

Zeqing He, Zhibo Wang, Zhixuan Chu, Huiyu Xu, Wenhui Zhang, Qinglong Wang, Rui Zheng

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09093 2025-04-23 cs.CR 78%

BaThe: Defense against the Jailbreak Attack in Multimodal Large Language Models by Treating Harmful Instruction as Backdoor Trigger

Yulin Chen, Haoran Li, Yirui Zhang, Zihao Zheng, Yangqiu Song, Bryan Hooi

专题命中 越狱攻击 :jailbreak(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10848 2025-02-11 cs.CV 78%

Perception-guided Jailbreak against Text-to-Image Models

Yihao Huang, Le Liang, Tianlin Li, Xiaojun Jia, Run Wang, Weikai Miao, Geguang Pu, Yang Liu

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments 9 pages, accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02534 2024-08-28 cs.CR cs.CV 78%

Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything

Xiaotian Zou, Ke Li, Yongkang Chen

专题命中 越狱攻击 :jailbreak(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19845 2024-07-12 cs.CR 78%

Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection

Yuqi Zhou, Lin Lu, Hanchi Sun, Pan Zhou, Lichao Sun

专题命中 越狱攻击 :jailbreak(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11868 2024-07-09 cs.CV 78%

To Generate or Not? Safety-Driven Unlearned Diffusion Models Are Still Easy To Generate Unsafe Images ... For Now

Yimeng Zhang, Jinghan Jia, Xin Chen, Aochuan Chen, Yihua Zhang, Jiancheng Liu, Ke Ding, Sijia Liu

专题命中 越狱攻击 :safety(title,abstract)

Comments Accepted by ECCV'24. Codes are available at https://github.com/OPTML-Group/Diffusion-MU-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00357 2024-06-21 cs.CV 78%

Safety of Multimodal Large Language Models on Images and Texts

Xin Liu, Yichen Zhu, Yunshi Lan, Chao Yang, Yu Qiao

专题命中 越狱攻击 :safety(title,abstract)

Comments Accepted at IJCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03805 2024-06-07 cs.CR 78%

AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens

Lin Lu, Hai Yan, Zenghui Yuan, Jiawen Shi, Wenqi Wei, Pin-Yu Chen, Pan Zhou

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments 32 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08416 2024-02-14 cs.CR 78%

Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning

Gelei Deng, Yi Liu, Kailong Wang, Yuekang Li, Tianwei Zhang, Yang Liu

专题命中 越狱攻击 :jailbreak(title,abstract)

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08715 2024-02-14 cs.CR 78%

MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots

Gelei Deng, Yi Liu, Yuekang Li, Kailong Wang, Ying Zhang, Zefeng Li, Haoyu Wang, Tianwei Zhang, Yang Liu

专题命中 越狱攻击 :jailbreak(title,abstract)

Journal ref The Network and Distributed System Security Symposium (NDSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04618 2022-11-10 cs.HC 78%

Discovering the Hidden Facts of User-Dispatcher Interactions via Text-based Reporting Systems for Community Safety

Yiren Liu, Ryan Mayfield, Yun Huang

专题命中 越狱攻击 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 77%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14161 2026-07-21 cs.LG 版本更新 77%

When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift

当基准谎言:在真实分布偏移下评估恶意提示分类器

Max Fomin

机构 * Zenity

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG

AI总结 研究通过LODO评估揭示了现有方法在真实分布偏移下的局限性,并展示了SAE特征在提升分类器解释性方面的潜力。

Comments v2: extended version of the AIWILD @ ICLR 2026 workshop paper; adds multi-model replication and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏