arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2406.14393 2025-04-22 cs.LG cs.CL 80%

Jailbreaking as a Reward Misspecification Problem

Zhihui Xie, Jiahui Gao, Lei Li, Zhenguo Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025. Code: https://github.com/zhxieml/remiss-jailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09222 2026-08-10 cs.SD cs.AI 版本更新 79%

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击

Yunqiang Wang, Hengyuan Na, Di Wu, Miao Hu, Guocong Quan

机构 * Sun Yat-Sen University(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。

Comments Accpeted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14751 2026-08-07 cs.CR cs.AI 版本更新 79%

One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs

一个泄漏:预训练模型暴露如何放大微调LLM中的劫持风险

Yixin Tan, Zhe Yu, Rui Wen, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) Riken AIP(理化学研究所AIP)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本研究揭示了预训练模型暴露如何放大微调LLM的劫持风险,提出PGP攻击方法,证明了预训练到微调过程中存在的安全漏洞。

Comments This paper has been accepted to the ACM SIGSAC Conference on Computer and Communications Security (ACM CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06519 2026-08-04 cs.CR cs.AI 版本更新 79%

Can Small Language Models Reliably Resist Jailbreak Attacks? A Comprehensive Evaluation

小型语言模型能否可靠抵御越狱攻击?一项综合评估

Zhibo Wang, Wenhui Zhang, Huiyu Xu, Zeqing He, Ziqi Zhu, Kui Ren

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。

Comments Accepted by ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 79%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12469 2026-07-15 cs.SE cs.AI 新提交 79%

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量

Oleg Solozobov

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。

Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01133 2026-07-01 cs.CR cs.LG cs.MA 版本更新 79%

When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems

基于嵌入的防御失效:重新思考基于大语言模型的多智能体系统的安全性

Lingxi Zhang, Guangtao Zheng, Hanjie Chen

机构 * Rice University(稻属大学) University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 研究探讨了基于嵌入的防御在多智能体系统中的失效模式,提出利用置信度信号提升系统鲁棒性,通过实验验证了早期干预的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16751 2026-06-16 cs.CR cs.AI 新提交 79%

Automated jailbreak attack targeting multiple defense strategies

针对多种防御策略的自动化越狱攻击

Qi Wang, Chengcheng Wan, Weijia He, Yanqing Li, Hanqi Sun, Xiaodong Gu, Jiangtao Wang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University of Southampton(南安普顿大学) Shanghai Jiao Tong University(上海交通大学) Software Engineering Institute, East China Normal University(东华大学软件工程研究院)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27025 2026-05-27 cs.CL cs.MM 79%

Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

基于属性的LLM与仇恨言论标注的对齐诊断

Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL

AI总结 通过分析LLM在十个主观属性上的判断与人类标注的对齐情况,发现行为显式维度对齐良好而评价维度系统性反转,并提出基于置信度加权岭回归的属性组合方法,重构连续仇恨言论分数,R²达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02832 2026-05-18 cs.CR cs.AI 79%

FlipAttack: Jailbreak LLMs via Flipping

FlipAttack:通过翻转对大型语言模型进行劫持

Yue Liu, Xiaoxin He, Miao Xiong, Jinlan Fu, Shumin Deng, Yingwei Ma, Jiaheng Zhang, Bryan Hooi

机构 * Engineering Programme, NUS Graduate School, National University of Singapore(国立新加坡大学整合科学与工程计划) Institute of Data Science (IDS), National University of Singapore(国立新加坡大学数据科学研究所) Department of Computer Science, School of Computing, National University of Singapore(国立新加坡大学计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 FlipAttack通过在提示左侧添加噪声,利用语言模型自左向右理解文本的特性,实现对黑盒LLM的高效劫持,实验显示其在多个模型上均表现出高成功率。

Comments 43 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13420 2026-05-13 cs.CR cs.AI 79%

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

通过前缀共享KV缓存加速后缀劫持攻击

Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。

Comments 27 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11003 2026-05-13 cs.CR cs.AI 79%

The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents

授权-执行间隙是开放世界智能体中的主要安全和安全问题

Baoyuan Wu, Qingshan Liu, Adel Bibi, Irwin King, Siwei Lyu

机构 * Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Nanjing University of Posts and Telecommunications, China(南京邮电大学) University of Oxford, UK(牛津大学) Chinese University of Hong Kong, China(香港中文大学) State University of New York at Buffalo, USA(纽约州立大学布法罗分校)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文指出开放世界智能体中授权-执行间隙(AEG)是安全和安全的关键问题,其源于授权意图与实际执行的差异,需通过源导向的诊断和防御来解决,强调执行中需进行授权完整性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10611 2026-05-12 cs.CR cs.AI 79%

Re-Triggering Safeguards within LLMs for Jailbreak Detection

在大语言模型中重新触发安全机制以检测劫持

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Yuzhe Huang, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi'an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出一种大语言模型劫持提示检测方法,通过重新激活内部安全机制提升防御能力,实验表明其在白盒和黑盒环境下有效抵御最新劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI 79%

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL 79%

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20945 2026-04-24 cs.CR cs.LG 79%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26238 2026-04-22 cs.LG 79%

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

超越线性探测:语言模型的动态安全监控

James Oldfield, Philip Torr, Ioannis Patras, Adel Bibi, Fazl Barez

机构 * Queen Mary University of London(伦敦玛丽女王大学) University of Oxford(牛津大学) WhiteBox Martian

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Truncated Polynomial Classifiers (TPCs),通过动态激活监控提升安全性能,实现灵活的成本控制,在有害提示分类中表现优异且更具可解释性。

Comments ICLR 2026; Minor revisions and clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10846 2026-04-17 cs.LG cs.CR 79%

AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models

AutoRAN:大型推理模型中安全推理的自动化劫持

Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Penn State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 AutoRAN通过执行模拟方法,利用较弱但对齐差的模型模拟初始劫持尝试,并通过目标LRM的拒绝泄露的推理模式迭代优化攻击,从而绕过安全防护并扩展有害指令。

Comments 10 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04930 2026-04-17 cs.CR cs.AI 79%

Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring

攻击选择降低集中AI控制设置中对可信监控的安全性

Joachim Schaeffer, Arjun Khandelwal, Tyler Tracy

机构 * Pivotal Research(Pivotal研究) University of Oxford(牛津大学) Redwood Research(Redwood研究)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究攻击选择如何通过映射攻击到质量评分和提交概率影响安全性能,发现FPR对安全影响更大,提示需谨慎评估模型攻击能力以避免安全评分过高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25164 2026-03-27 cs.CR cs.AI 79%

PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems

PIDP-Attack:将提示注入与数据库污染攻击结合在检索增强生成系统中

Haozhen Wang, Haoyue Liu, Jionghao Zhu, Zhichao Wang, Yongxin Guo, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝和天猫集团)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出PIDP-Attack,结合提示注入与数据库污染攻击,针对检索增强生成系统中的对抗攻击问题,通过在推理时添加恶意字符并注入少量污染文档,有效操控LLM响应,实验显示其在开放域问答任务中攻击成功率提升4%-16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11149 2026-03-20 cs.LG cs.CR 79%

Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models

大语言模型中越狱攻击的系统缩放分析

Xiangwen Wang, Ananth Balashankar, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文系统分析了大语言模型中越狱攻击的缩放规律,通过计算限制优化过程评估不同方法、模型家族和危害类型的攻击成功率,发现提示基方法在计算效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 79%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11495 2026-02-23 cs.CR cs.CL 79%

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16520 2026-02-19 cs.CR cs.AI 79%

Recursive language models for jailbreak detection: a procedural defense for tool-augmented agents

递归语言模型用于对抗检测:一种针对工具增强代理的程序性防御

Doron Shavit

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出基于递归语言模型的RLM-JB框架,通过程序化方法检测对抗性输入,实现高检测效果与高精度的平衡。

Comments 5 pages and 1 figure. Appendix: an additional 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02649 2026-02-18 cs.AI 79%

From Prompts to Protection: Large Language Model-Enabled In-Context Learning for Smart Public Safety UAV

从提示到保护:基于大语言模型的上下文学习用于智能公共安全无人机

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida, Zhu Han

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教大学) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Instituto de Telecomunicações, Faculdade de Engenharia, Universidade do Porto(电信研究所,工程学院,葡萄牙里斯本大学) University of Houston(休斯顿大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的上下文学习提升公共安全无人机的自主决策能力,通过自然语言提示和示例指导实现路径规划和速度控制,减少数据丢失并缓解安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05877 2026-02-06 cs.AI cs.HC 79%

Agent2Agent Threats in Safety-Critical LLM Assistants: A Human-Centric Taxonomy

安全关键型LLM助手中的Agent2Agent威胁:以人为中心的分类

Lukas Stappen, Ahmet Erkan Turan, Johann Hagerer, Georg Groh

机构 * BMW Group Research(宝马集团研究) Technical University Munich(慕尼黑技术大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AgentHeLLM框架,通过分离资产识别与攻击路径分析,为安全关键型LLM助手提供以人为中心的威胁建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12460 2026-01-21 cs.CR cs.LG 79%

TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning

TrojanPraise: 通过良性微调劫持LLM

Zhixin Xie, Xurui Song, Jun Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05742 2026-01-12 cs.CR cs.AI 79%

The Echo Chamber Multi-Turn LLM Jailbreak

回声室多轮LLM劫持

Ahmad Alobaid, Martí Jordà Roca, Carlos Castillo, Joan Vendrell

机构 * NeuralTrust ICREA and UPF(ICREA和UPF)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 Echo Chamber是一种利用逐步升级方法的多轮攻击,旨在绕过聊天机器人的安全防护,通过精心设计的交互链对LLM进行劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22488 2025-12-30 cs.LG cs.CV 79%

Toward Real-World IoT Security: Concept Drift-Resilient IoT Botnet Detection via Latent Space Representation Learning and Alignment

迈向现实世界的物联网安全:通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测

Hassan Wasswa, Timothy Lynar

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测框架,有效解决传统方法在动态环境中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11783 2025-12-15 cs.CR cs.AI 79%

Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously

超后缀:同时绕过文本生成对齐和防护模型

Andrew Adiletta, Kathryn Adiletta, Kemal Derya, Berk Sunar

机构 * MITRE(MITRE公司) Worcester Polytechnic Institute(沃斯顿理工学院)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出超后缀技术,通过联合优化绕过Llama Prompt Guard 2,同时提出DeltaGuard检测方法提升对抗性提示防御效果。

Comments 13 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏