arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2606.28153 2026-06-29 cs.CR cs.AI 新提交 85%

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

越狱攻击下的鲁棒有害特征:来自大型语言模型中注意力头特化的机制证据

Yanchen Yin, Dongqi Han, Linghui Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 通过分析注意力头特化,发现越狱攻击通过抑制早期层的对抗妥协头(ACHs)绕过安全对齐,而中间层的安全对齐头(SAHs)保持鲁棒激活,揭示了鲁棒有害特征现象,并利用这些持久激活实现无需训练的检测。

Comments 33 pages, 19 figures. Accepted at ICML 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 85%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16527 2026-06-16 cs.CR cs.CL 新提交 85%

DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

DoubtProbe:通过结构验证与语义审计的黑盒越狱防御

Xuanyu Yin, Yilin Jiang, Jun Zhou, Kai Chen, Zhengfu Cao, Xiaolei Dong

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出DoubtProbe双分支推理时防御框架,结合结构验证与语义审计,将黑盒越狱防御转化为受控变换下的一致性检查,在多个基准上实现更强更稳定的防御-效用权衡。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 85%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07706 2026-06-09 cs.CR cs.AI 新提交 85%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17231 2026-06-09 cs.CL cs.CR 版本更新 85%

Efficient and Stealthy Jailbreak Attacks via Adversarial Prompt Distillation from LLMs to SLMs

通过从大语言模型到小语言模型的对抗性提示蒸馏实现高效且隐蔽的越狱攻击

Xiang Li, Chong Zhang, Jia Wang, Fangyu Wu, Yushi Li, Xiaobo Jin

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学) University of Liverpool(利物浦大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出对抗性提示蒸馏(APD)框架,将LLM的越狱能力迁移到SLM,实现高效低资源攻击,在GPT-4上达到96.4%攻击成功率,速度提升3.7倍,参数减少11.3倍。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05743 2026-06-05 cs.CR cs.CL 85%

Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

Membrane: 一种用于LLM智能体防御的自演化对比安全记忆

Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

机构 * KAIST AI(韩国科学技术院人工智能实验室) Financial Tech Lab, KakaoBank Corp(Kakao银行金融科技实验室)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 提出Membrane,一种基于对比安全记忆(CSM)的自演化护栏,通过将有害交互及其良性对应物蒸馏为对比单元来防御不断演化的越狱攻击,无需重新训练即可实现高F1和低良性拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06911 2026-06-04 cs.CR cs.AI 85%

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

TamperBench:系统化压力测试微调和篡改下的LLM安全性

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla

机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) FAR.AI Berkeley USA(伯克利美国FAR.AI公司) University of Toronto Toronto Canada(多伦多大学) University of Waterloo Waterloo Canada(Waterloo大学) ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09755 2026-06-03 cs.CR cs.LG 85%

Jailbreak Attack Initializations as Extractors of Compliance Directions

越狱攻击初始化作为合规方向的提取器

Amit Levi, Rom Himelstein, Yaniv Nemcovsky, Avi Mendelson, Chaim Baskin

机构 * Department of Computer Science, Technion - Israel Institute of Technology(技术学院计算机科学系) Department of Data and Decision Science, Technion - Israel Institute of Technology(技术学院数据与决策科学系) School of Electrical and Computer Engineering Engineering, Ben-Gurion University of the Negev(内盖夫本· Gurion大学电气与计算机工程学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文发现基于梯度的越狱攻击初始化会收敛到抑制拒绝的单一合规方向,并据此提出CRI框架,通过沿合规方向投影未见提示来提高攻击成功率并降低计算开销。

Comments Accepted to Findings of the Association for Computational Linguistics 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18543 2026-05-26 cs.CR cs.AI 85%

SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models

SoK: GPT 和 DeepSeek 模型越狱鲁棒性的全面安全分析

Xiaodong Wu, Xiangman Li, Qi Li, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(女王大学) University of Waterloo(滑铁卢大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 通过 HarmBench 基准测试,对 DeepSeek 模型系列与 GPT-3.5、GPT-4 进行首次全面越狱分析,发现 DeepSeek 对优化驱动攻击有部分鲁棒性但易受提示工程攻击,而 GPT-4 Turbo 具有更一致的安全对齐,揭示了模型效率与对齐泛化之间的固有权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23157 2026-05-25 cs.CL 85%

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面

Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

机构 * Appen(Appliance)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05709 2026-05-08 cs.AI 85%

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai

机构 * NC State University(北卡罗来纳州立大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。

Comments 39 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24672 2026-04-20 cs.CL 85%

TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis

TRIDENT:通过三维多样化红队数据合成增强大语言模型安全性

Xiaorui Wu, Xiaofeng Mao, Fei Li, Xin Zhang, Xuanhong Li, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室,教育部,网络安全工程学院,武汉大学) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(计算技术学院,皇家墨尔本理工学院)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 TRIDENT通过三维分析框架和自动化流水线生成涵盖词汇多样性、恶意意图和突破战术的多样化数据,提升大语言模型安全性,实验显示在有害内容评分和攻击成功率上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI 85%

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01375 2026-04-03 cs.AI 85%

Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges

对齐以错位:基于元优化LLM评判者的自动LLM劫持

Hamin Koo, Minseon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出AMIS框架,通过双层结构联合优化劫持提示和评分模板,提升LLM劫持效果,实测在AdvBench和JBB-Behaviors上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28817 2026-04-01 cs.CR cs.AI 85%

GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models

GUARD-SLM:基于令牌激活的对抗 Jailbreak 攻击防御方法用于小语言模型

Md Jueal Mia, Joaquin Molto, Yanzhao Wu, M. Hadi Amini

机构 * Knight Foundation School of Computing and Information Sciences(奈特基金会计算与信息科学学院) Security, Optimization, and Learning for InterDependent networks laboratory (solid lab)(安全、优化与相互依赖网络学习实验室) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了小语言模型在面对异构攻击时的脆弱性,提出GUARD-SLM方法通过分析隐藏层激活来过滤恶意提示,提升小语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17372 2026-03-19 cs.CV cs.AI 85%

Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift

通过与劫持相关的表示转移理解并防御VLM劫持

Zhihua Wei, Qiang Li, Jian Ruan, Zhenxin Qin, Leilei Wen, Dongrui Liu, Wen Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究VLM在视觉模态整合后安全对齐减弱的问题,发现劫持样本在表示空间中形成独特状态,提出通过移除劫持相关转移提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11301 2026-03-17 cs.AI 85%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11790 2026-03-11 cs.LG cs.CR 85%

JULI: Jailbreak Large Language Models by Self-Introspection

通过自我反思 jailbreak 大型语言模型:JULI

Jesson Wang, Zhanhao Hu, David Wagner

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 JULI 通过操纵令牌日志概率,利用微小插件块 BiasNet 实现对 API 调用 LLMs 的 jailbreak,无需模型权重或生成过程权限,且在黑盒环境下有效。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03081 2026-03-04 cs.CL 85%

TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models

TAO-Attack:迈向大型语言模型的高级优化基 Jailbreak 攻击

Zhi Xu, Jiaqi Li, Xiaotong Zhang, Hong Yu, Han Liu

机构 * Dalian University of Technology(大连理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 TAO-Attack 提出了一种基于优化的 Jailbreak 攻击方法,通过双阶段损失函数和方向优先 token 优化策略,有效提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21910 2026-03-03 cs.LG 85%

Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks

对抗性 déjà vu:用于更强泛化到未见攻击的 jailbreak 字典学习

Mahavir Dabas, Tran Huynh, Nikhil Reddy Billa, Jiachen T. Wang, Peng Gao, Charith Peris, Yao Ma, Rahul Gupta, Ming Jin, Prateek Mittal, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Princeton University(普林斯顿大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出通过对抗性技能组合训练提升模型对未知攻击的鲁棒性,通过分析攻击论文发现新型攻击是旧技能的重新组合,从而改进安全防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01784 2026-03-03 cs.CR cs.AI 85%

Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution

基于结构对抗进化的多模态对齐

Guoxin Shi, Haoyu Wang, Zaihui Yang, Yuxing Wang, Yongzhe Chang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出CEMA框架,通过共进化对抗提升多模态对齐的鲁棒性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17568 2026-03-03 cs.CR cs.AI cs.SD eess.AS 85%

JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models

JALMBench: 对音频语言模型中越权攻击的基准测试

Zifan Peng, Yule Liu, Zhen Sun, Mingchen Li, Zeren Luo, Jingyi Zheng, Wenhan Dong, Xinlei He, Xuechao Wang, Yingjie Xue, Shengmin Xu, Xinyi Huang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室) University of North Texas(北卡罗来纳州立大学) University of Science and Technology of China(中国科学技术大学) Fujian Normal University(福建师范大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 JALMBench通过评估11,316个文本样本和245,355个音频样本,分析LALMs对越权攻击的安全性,揭示模态和架构对安全性的影响,强调需专门设计的防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11097 2026-02-11 cs.CL 85%

The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs

面具背后的魔鬼:扩散语言模型的新兴安全漏洞

Zichen Wen, Jiashu Qu, Zhaorun Chen, Xiaoya Lu, Dongrui Liu, Zhiyuan Liu, Ruixi Wu, Yicun Yang, Xiangqi Jin, Haoyun Xu, Xuyang Liu, Weijia Li, Chaochao Lu, Jing Shao, Conghui He, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Chicago(芝加哥大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 DIJA揭示了扩散语言模型的安全漏洞,通过构造对抗性提示利用双向建模和并行解码机制,使有害内容在对齐训练模型中得以生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05444 2026-02-09 cs.CL 85%

Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs

因果前门调整用于对抗大语言模型的鲁棒性劫持攻击

Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Hong Kong University of Science and Technology, China, Hong Kong, China(香港科学与技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出CFA²攻击方法,通过因果前门准则和稀疏自编码器实现对大语言模型的鲁棒性劫持,提升攻击成功率并提供机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05052 2026-02-04 cs.CR cs.CL 85%

Proactive defense against LLM Jailbreak

主动防御对抗大语言模型劫持

Weiliang Zhao, Jinjun Peng, Daniel Ben-Levi, Zhou Yu, Junfeng Yang

机构 * Department of Computer Science, Columbia University, US(计算机科学系,哥伦比亚大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 ProAct通过主动误导劫持方法,显著降低攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 85%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 85%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03288 2026-01-08 cs.CR cs.CL 85%

How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference

你的 jailbreak 真的可信吗?基于锚定参考的细粒度 jailbreak 评估

Songyang Liu, Chaozhuo Li, Rui Pu, Litian Zhang, Chenxu Wang, Zejian Chen, Yuting Zhang, Yiming Hei

机构 * Key Laboratory of Trustworthy Distributed Computing(可信分布式计算重点实验室) Service Beijing University of Posts(北京邮电大学) Artificial Intelligence Research Institute China Academy of Information(人工智能研究所信息与通信技术 academy)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出 FJAR 框架,通过细粒度分类和锚定参考方法,评估 jailbreak 攻击的真实性和失败原因,提升攻击策略改进的指导性。

Comments 7 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07167 2026-01-05 cs.CR cs.CL 85%

One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models

一个触发标记就足够:一种在大型语言模型中平衡安全性和可用性的防御策略

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究提出D-STT算法,通过识别和解码安全触发标记,有效提升大型语言模型的安全性,同时保持其可用性与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏