arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2604.20771 2026-04-23 cs.CR cs.AI 57%

DAIRE: A lightweight AI model for real-time detection of Controller Area Network attacks in the Internet of Vehicles

DAIRE:一种轻量级AI模型,用于实时检测车联网中的控制器局域网络攻击

Shahid Alam, Amina Jameel, Zahida Parveen, Ehab Alnfrawy, Adeela Ashraf, Raza Uddin, Jamal Aqib

机构 * Department of Information Security, College of Computer Science and Engineering, University of Ha’il(信息安全系,计算机科学与工程学院,哈伊尔大学) Department of Computer Engineering, Center of Excellence in Artificial Intelligence, Bahria University(计算机工程系,人工智能卓越中心,巴赫里大学) Department of Artificial Intelligence, College of Computer Science and Engineering, University of Ha’il(人工智能系,计算机科学与工程学院,哈伊尔大学) Department of Computer Science, College of Computer Science and Engineering, University of Ha’il(计算机科学系,计算机科学与工程学院,哈伊尔大学) Department of Software Engineering, College of Computer Science and Engineering, University of Ha’il(软件工程系,计算机科学与工程学院,哈伊尔大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出DAIRE模型,利用轻量级神经网络实现实时检测和分类CAN攻击,实验显示其在准确率和速度上均优于现有方法。

Journal ref Machine Learning with Applications (2026): 100859

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21893 2026-04-22 cs.LG 57%

Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(隆德大学) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18663 2026-04-22 cs.CR cs.AI 57%

Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation

超越显式拒绝:针对检索增强生成的软故障攻击

Wentao Zhang, Yan Zhuang, ZhuHang Zheng, Mingfei Zhang, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Institute for Advanced Study(深圳先进研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出DEJA攻击框架,通过进化优化生成对抗文档,诱导系统产生非信息性但流畅的响应,降低回答确定性,实验显示其在多个RAG配置中有效,SASR超过79%。

Comments 22 pages, Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06414 2026-04-22 cs.CR cs.AI 57%

Benchmarking Misuse Mitigation Against Covert Adversaries

对抗隐蔽攻击的误用缓解基准测试

Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出BSD基准测试,用于评估对抗隐蔽攻击的防御策略,通过生成两个拒绝前沿模型的难数据集,揭示分解攻击的有效性及状态化防御的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI 57%

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16543 2026-04-21 cs.MA cs.AI 57%

Conjunctive Prompt Attacks in Multi-Agent LLM Systems

多智能体大语言模型中的联合提示攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究多智能体系统中联合提示攻击的机制与防御,通过路由优化提升攻击成功率并降低误触发率,揭示了智能体流水线的结构性漏洞。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11623 2026-04-17 cs.AI cs.SE 57%

Context Kubernetes: Declarative Orchestration of Enterprise Knowledge for Agentic AI Systems

上下文Kubernetes:面向代理AI系统的企业知识声明式编排

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(开放技术研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Context Kubernetes架构,通过声明式知识架构-as-code和三层权限模型,解决企业知识在代理AI系统中的安全编排问题,实验表明其在治理和安全性方面优于传统方法。

Comments 24 pages, 8 tables, 1 figure, 8 experiments (5 correctness + 3 value). Open-source prototype: https://github.com/Cohorte-ai/context-kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG 57%

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 57%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07615 2026-04-10 cs.CL 57%

ADAG: Automatically Describing Attribution Graphs

ADAG:自动描述归因图

Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

机构 * Stanford University(斯坦福大学) Transluce

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 ADAG通过自动化方法描述归因图,利用归因轮廓和聚类算法生成可解释的电路结构,并发现Llama 3.1 8B Instruct中的有害建议 jailbreak聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02670 2026-04-10 cs.CL 57%

Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting

攻破我:通过词性插入提示实现对对齐大语言模型的自我越狱

Devang Kulshreshtha, Hang Su, Haibo Jin, Chinmay Hegde, Haohan Wang

机构 * Amazon(亚马逊) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 本文提出自我越狱方法,通过词性插入提示对齐大语言模型进行攻击,实验表明SLIP在多个模型上实现高攻击成功率,提出SDM防御机制但发现其对自适应攻击策略仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04951 2026-04-08 cs.CR cs.AI 57%

Synthetic Trust Attacks: Modeling How Generative AI Manipulates Human Decisions in Social Engineering Fraud

合成信任攻击:生成式AI如何操纵人类在社会工程欺诈中的决策

Muhammad Tahir Ashraf

机构 * AAAI Pakistan Chapter(AAAI巴基斯坦分会) PureDesigners Ltd.(PureDesigners有限公司) IBM Watson

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出合成信任攻击(STA)作为正式威胁类别,引入STAM模型,涵盖从敌手侦察到事后利用的完整攻击链,探讨人类决策层的防御策略。

Comments 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 57%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 57%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 57%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03205 2026-04-06 cs.CR cs.LG 57%

A Tsetlin Machine-driven Intrusion Detection System for Next-Generation IoMT Security

基于Tsetlin机器的下一代IoMT安全入侵检测系统

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(挪威阿格德尔大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于Tsetlin机器的入侵检测系统,用于检测针对IoMT网络的多种网络攻击,通过命题逻辑建模攻击模式,实验表明其在二分类和多分类中均优于传统机器学习分类器。

Comments 8 pages, 15 figures, 9 tables. Accepted at the 7th Silicon Valley Cybersecurity Conference (SVCC 2026), California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 57%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25941 2026-03-16 cs.CL 57%

RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline

RECAP:通过代理流水线从LLM训练中重现受版权保护的数据

André V. Duarte, Xuying li, Bin Zeng, Arlindo L. Oliveira, Lei Li, Zhuo Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) Hydrox AI

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10163 2026-03-12 cs.CR cs.AI 57%

Compatibility at a Cost: Systematic Discovery and Exploitation of MCP Clause-Compliance Vulnerabilities

兼容性代价:系统性发现和利用MCP条款合规性漏洞

Nanzi Yang, Weiheng Bai, Kangjie Lu

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出首个系统性框架,用于分析MCP条款合规性漏洞,通过构建中间表示、静态分析和攻击模式引导管道,发现并利用兼容性滥用攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10092 2026-03-12 cs.CR cs.AI 57%

Execution Is the New Attack Surface: Survivability-Aware Agentic Crypto Trading with OpenClaw-Style Local Executors

执行是新的攻击面:面向OpenClaw风格的生存意识代理加密交易

Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Serhii Hovorov, Sofiia Pidturkina

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出SAE,一种针对OpenClaw风格系统的生存意识执行标准,通过定义执行合同和强制执行不变量,提高代理加密交易的生存能力。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11247 2026-03-09 cs.CR cs.AI 57%

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

峰值+累积:多轮LLM攻击检测的代理层评分公式

J Alex Corll

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出一种基于峰值和累积的代理层评分公式,用于多轮LLM攻击检测,实现高召回率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08207 2026-03-04 cs.AI 57%

Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking

面向动态Stackelberg博弈框架的代理AI防御对抗大语言模型劫持

Zhengye Han, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出动态Stackelberg博弈框架,用于代理AI防御对抗大语言模型劫持,通过RRT搜索和博弈树分析提升防御效果。

Comments Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01574 2026-03-03 cs.CR cs.AI 57%

DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern

DualSentinel: 一种用于通过双熵低谷模式检测黑盒LLM中针对性攻击的轻量级框架

Xiaoyi Pang, Xuanyi Hao, Pengyu Liu, Qi Luo, Song Guo, Zhibo Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) School of Cyber Science and Technology(网络安全科学与技术学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 DualSentinel通过双熵低谷模式检测黑盒LLM中的针对性攻击,提供高效且准确的防御方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI 57%

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00131 2026-03-03 cs.MA cs.AI 57%

Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems

Thought Virus: 通过潜意识提示在多智能体系统中产生病毒性偏差

Moritz Weckbecker, Jonas Müller, Ben Hagag, Michael Mulet

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本研究揭示了多智能体系统中通过潜意识提示传播偏见的风险,指出单个智能体的潜意识提示可能影响整个网络的诚实性,提出新的安全攻击向量。

Comments 18 pages, 10 figures, 2 tables. Code available at https://github.com/Multi-Agent-Security-Initiative/thought_virus

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 57%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14166 2026-02-17 cs.CR cs.AI 57%

IntentMiner: Intent Inversion Attack via Tool Call Analysis in the Model Context Protocol

IntentMiner: 通过模型上下文协议中的工具调用分析进行意图倒置攻击

Yunhao Yao, Zhiqiang Wang, Haoran Cheng, Yihang Cheng, Haohua Du, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 IntentMiner通过分析模型上下文协议中的工具调用,揭示了意图倒置攻击的机制,实现了超过85%的语义对齐,挑战了AI代理的隐私基础。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 57%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10222 2026-02-12 cs.SD cs.AI 57%

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard

针对多模态大语言模型的语音音频组合攻击及其通过SALMONN-Guard的缓解

Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Cambridge(剑桥大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对多模态LLMs的安全性,提出SACRED-Bench评估语音音频组合攻击,并通过SALMONN-Guard将攻击成功率降低至20%。

详情

展开后加载摘要…

URL PDF HTML 收藏