arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2508.10029 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出

Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han

机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) Guangzhou University(广州大学) Chongqing University(重庆大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10031 2026-07-07 cs.CR cs.AI cs.CL 版本更新 84%

Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

上下文误导大语言模型:上下文过滤在维持大语言模型安全对齐中的作用

Jinhwa Kim, Ian G. Harris

机构 * Department of Computer Science University of California, Irvine(计算机科学系,加州大学伊维特分校)

专题命中 越狱攻击 :alignment(title);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型受恶意上下文欺骗问题,提出上下文过滤防御机制,通过过滤不可信上下文识别真实意图,提升安全性同时保持性能,经对比分析验证其有效性。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12418 2026-06-30 cs.CR cs.CL cs.LG 84%

Sparse Autoencoders are Capable LLM Jailbreak Mitigators

稀疏自编码器是LLM劫持攻击缓解器

Yannick Assogba, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez, Xavier Suau, Arno Blaas

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25487 2026-06-26 cs.CL cs.CR cs.LG 新提交 84%

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

你的越狱评判有多可靠?自动ASR评分的校准与对抗鲁棒性

Yang Gao

机构 * Veyon Solutions

专题命中 越狱攻击 :jailbreak(title);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了LLM越狱攻击成功率(ASR)的自动评判器(安全分类器与LLM评判)的可靠性,发现两者存在相反缺陷,且易受攻击,建议报告评判器的精确率和召回率并校正ASR。

Comments 10 pages, 3 figures, 2 tables, Code: github.com/gy15901580825/judgeflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03226 2026-06-09 cs.LG cs.AI cs.CR 版本更新 84%

Self-Mined Hardness for Safety Fine-Tuning

自我挖掘的难度用于安全微调

Prakhar Gupta, Garv Shah, Donghua Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01738 2026-06-02 cs.CL cs.AI 84%

THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models

THRD:一种针对大语言模型越狱攻击的无训练多轮防御框架

Zhiqing Ma, Zhonghao Xu, Dong Yu, Chen Kang, Changliang Li, Pengyuan Liu

机构 * Beijing Language and Culture University(北京语言大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练框架THRD,通过显式建模时间风险累积(包括逐轮风险评估、跨轮意图检测、响应评估和决策模块)防御多轮越狱攻击,将攻击成功率降至0.2-4.0%且模型效用损失小于1.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11832 2026-06-02 cs.AI cs.LG 84%

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

安全幻象:虚假相关性如何破坏VLM安全微调及通过机器遗忘缓解

Yiwei Chen, Yuguang Yao, Yihua Zhang, Bingquan Shen, Gaowen Liu, Sijia Liu

机构 * Michigan State University(密歇根州立大学) National University of Singapore(新加坡国立大学) Cisco Research(思科研究)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文发现视觉语言模型(VLM)的安全微调存在“安全幻象”,即虚假相关性导致脆弱性,并提出机器遗忘作为替代方案,显著降低攻击成功率和不必要拒绝。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28030 2026-05-28 cs.LG cs.AI cs.CR 84%

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

SPARD: 通过安全投影与相关性-多样性数据选择防御有害微调攻击

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Platform and Content Group, Tencent(腾讯平台与内容组) Chinese Medicine Guangdong Laboratory(广东中医实验室)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出SPARD框架,结合安全投影交替优化和相关性-多样性数据选择,防御有害微调攻击,在保持任务精度的同时显著降低攻击成功率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24817 2026-05-26 cs.CR cs.AR cs.CL cs.LG 84%

RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry

RouteScan: 通过专家路由遥测对MoE大语言模型安全性进行非侵入式审计

Bo Lv, Zhiheng Xu, KeDong Xiu, Ruyi Ding, Tianhang Zheng, Zhibo Wang, Kui Ren

机构 * Zhejiang University(浙江大学) Donghua University(东华大学) Louisiana State University(路易斯安那州立大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 提出RouteScan,一种利用MoE模型GPU级专家路由遥测(如预填充阶段活跃线程数)作为微架构指纹,通过轻量级检测流水线识别恶意提示的非侵入式审计框架,在未见过的有害领域AUROC超0.93,新越狱包装下超0.96,且相比基于内容的审计方法具有隐私优势。

Comments 20 pages. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24296 2026-03-27 cs.CL cs.AI 84%

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复

Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Squirrel Ai Learning(松鼠AI) Peking University(北京大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23269 2026-03-25 cs.CR cs.AI cs.LG 84%

Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs

并非所有标记都同等重要:面向LLMs的查询高效 jailbreak 模糊测试

Wenyu Chen, Xiangtao Meng, Chuanchao Zang, Li Wang, Xinyu Gao, Jianing Wang, Peng Zhan, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TriageFuzz框架,通过分析标记贡献差异,提升jailbreak攻击效率,实验显示在减少查询次数的情况下,攻击成功率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15527 2026-03-17 cs.AI cs.CY 84%

Are Dilemmas and Conflicts in LLM Alignment Solvable? A View from Priority Graph

对LLM对齐中的困境和冲突是否可解?一种优先图的视角

Zhenheng Tang, Xiang Liu, Qian Wang, Eunsol Choi, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) New York University(纽约大学) National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文通过优先图模型分析LLM在不同场景中的冲突与困境,揭示了统一稳定对齐的挑战及优先黑客的潜在风险,并提出运行时验证机制以提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01291 2026-03-03 cs.LG cs.CL 84%

JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks

JailNewsBench: 多语言和区域假新闻生成对抗基准

Masahiro Kaneko, Ayana Niwa, Timothy Baldwin

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 JailNewsBench 是首个评估大语言模型对抗jailbreak攻击生成假新闻鲁棒性的多语言和区域基准,揭示了不同语言和区域间安全性的不平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13321 2026-02-17 cs.AI cs.LG 84%

Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction

通过自动化语言特征提取检测临床训练LLM中的劫持尝试

Tri Nguyen, Huy Hoang Bao Le, Lohith Srikanth Pentapalli, Laurah Turner, Kelly Cohen

机构 * University of Cincinnati(克利夫兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过自动化语言特征提取,利用BERT模型预测四个核心语言特征,以检测临床训练LLM中的劫持尝试,验证了该方法的有效性及可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04893 2026-02-06 cs.LG cs.AI cs.CR 84%

A Causal Perspective for Enhancing Jailbreak Attack and Defense

从因果视角提升对抗攻击与防御

Licheng Pan, Yunsheng Lu, Jiexi Liu, Jialing Tao, Haozhe Feng, Hui Xue, Zhixuan Chu, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) University of Chicago(芝加哥大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Causal Analyst框架,通过因果分析提升大语言模型的对抗攻击与防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13893 2026-02-05 cs.CL cs.AI 84%

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

守护护栏:一种基于分类的 Jailbreak 检测方法

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于分类的 Jailbreak 检测方法,通过构建分层分类体系,分析攻击类型,评估提示引导效果,并建立新的多轮对抗对话数据集,以提升对 Jailbreak 技术的检测能力。

Comments 2nd Conference on International Association for Safe & Ethical AI (IASEAI 2026), 24-26 February 2026, UNESCO House, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04196 2026-02-05 cs.CL cs.LG 84%

The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment

缺失的一半:揭示训练时间隐含的安全风险

Zhexin Zhang, Yida Lu, Junfeng Fang, Junxiao Yang, Shiyao Cui, Hao Zhou, Fandong Meng, Jie Zhou, Hongning Wang, Minlie Huang, Tat-Seng Chua

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话研究院) National University of Singapore(新加坡国立大学) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统研究训练期间隐式安全风险,揭示模型内部激励和上下文信息驱动的有害行为,并通过实验展示其广泛存在和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01587 2026-02-03 cs.CL cs.AI 84%

Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment

通过噪声增强对齐的可证明防御框架对抗LLM劫持

Zehua Cheng, Jianwei Yang, Wei Dai, Jiahao Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过噪声增强对齐的可证明防御框架,有效降低LLM劫持攻击成功率,提升模型鲁棒性与实用性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23081 2026-02-02 cs.CL cs.AI cs.CR 84%

Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures

字符作为大语言模型中的潜在变量:对涌现偏差和条件安全失败的机制解释

Yanghao Su, Wenbo Zhou, Tianwei Zhang, Qiu Han, Weiming Zhang, Nenghai Yu, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :safety(title);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了大语言模型中字符层面倾向对齐风险的核心机制,指出行为倾向的稳定转变是导致涌现偏差和安全失败的关键因素,而非单纯的能力退化或提示防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14558 2026-01-26 cs.CR cs.AI cs.CL 84%

LLM Jailbreak Detection for (Almost) Free!

几乎免费的LLM劫持检测

Guorui Chen, Yifan Xia, Xiaojun Jia, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Nanyang Technological University(南洋理工大学) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种几乎免费的LLM劫持检测方法,通过调整输入指令和logits温度来提高检测性能,无需额外计算成本。

Comments EMNLP 2025 (Findings) https://aclanthology.org/2025.findings-emnlp.309/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15782 2025-12-19 cs.CR cs.CL cs.LG 84%

Auto-Tuning Safety Guardrails for Black-Box Large Language Models

为黑盒大语言模型自动调整安全防护栏

Perry Abdulkadir

机构 * University of St. Thomas(圣托马斯大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过超参数优化来自动调整黑盒大语言模型的安全防护栏,以提高其安全性和效率。

Comments 8 pages, 7 figures, 1 table. Work completed as part of the M.S. in Artificial Intelligence at the University of St. Thomas using publicly available models and datasets; all views and any errors are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10519 2025-11-14 cs.CL cs.AI 84%

Say It Differently: Linguistic Styles as Jailbreak Vectors

Srikant Panda, Avinash Rai

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03343 2025-11-04 cs.CR cs.AI cs.CL 84%

What Features in Prompts Jailbreak LLMs? Investigating the Mechanisms Behind Attacks

Nathalie Kirch, Constantin Weisser, Severin Field, Helen Yannakoudakis, Stephen Casper

机构 * King’s College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Deepgram University of Louisville(路易斯维尔大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07146 2025-10-15 cs.LG cs.CL 84%

Attention-Aware GNN-based Input Defense against Multi-Turn LLM Jailbreak

Zixuan Huang, Kecheng Huang, Lihao Yin, Bowei He, Huiling Zhen, Mingxuan Yuan, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11308 2025-08-26 cs.AI cs.CL cs.CR 84%

Defending against Jailbreak through Early Exit Generation of Large Language Models

Chongwen Zhao, Zhihao Dou, Kaizhu Huang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05087 2025-08-08 cs.MM cs.AI cs.CL cs.CR 84%

JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering

Renmiao Chen, Shiyao Cui, Xuancheng Huang, Chengwei Pan, Victor Shea-Jay Huang, QingLin Zhang, Xuan Ouyang, Zhexin Zhang, Hongning Wang, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学DCST学院) Beihang University(北航大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 tables, 2 figures, to appear in the Proceedings of the 33rd ACM International Conference on Multimedia (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01550 2025-07-16 cs.LG cs.CL cs.CR 84%

Representation Bending for Large Language Model Safety

Ashkan Yousefpour, Taeheon Kim, Ryan S. Kwon, Seungbeen Lee, Wonje Jeung, Seungju Han, Alvin Wan, Harrison Ngan, Youngjae Yu, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Yonsei University(延世大学) AIM Intelligence(AIM智能) University of Michigan(密歇根大学) Stanford University(斯坦福大学) Amazon AWS(亚马逊AWS)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19537 2025-07-15 cs.CR cs.AI cs.LG 84%

No, of Course I Can! Deeper Fine-Tuning Attacks That Bypass Token-Level Safety Mechanisms

Joshua Kazdan, Abhay Puri, Rylan Schaeffer, Lisa Yu, Chris Cundy, Jason Stanley, Sanmi Koyejo, Krishnamurthy Dvijotham

机构 * Stanford(斯坦福大学) ServiceNow Research(ServiceNow研究机构) University of Toronto(多伦多大学) FAR AI(FAR人工智能公司)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04365 2025-07-08 cs.CR cs.AI cs.CL 84%

Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs

Xiaomeng Hu, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong Sha Tin, Hong Kong(香港中文大学沙田分校) IBM Research New York, USA(IBM纽约研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11682 2025-06-10 cs.CL cs.AI cs.CR 84%

Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models

Shangqing Tu, Zhuoran Pan, Wenxuan Wang, Zhexin Zhang, Yuliang Sun, Jifan Yu, Hongning Wang, Lei Hou, Juanzi Li

机构 * Tsinghua Univerisity(清华大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港理工大学) Beihang Univerisity(北京航空航天大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD 2025 research track

详情

展开后加载摘要…

URL PDF HTML 收藏