arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1721 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1721 篇

2601.05150 2026-06-01 cs.CR 50%

$PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models

$PC^2$:通过基于GPT的文本到图像模型的越狱攻击生成政治争议内容

Wonwoo Choi, Minjae Seo, Minkyoo Song, Hwanjo Heo, Seungwon Shin, Myoungsung You

专题命中 越狱攻击 :safety(abstract)

AI总结 提出首个黑盒政治越狱框架$PC^2$,利用身份保留描述映射和地缘政治远距离翻译绕过安全过滤器,在GPT系列模型上实现高达86%的攻击成功率。

Comments To appear in the 33rd ACM Conference on Computer and Communications Security (CCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26384 2026-05-27 cs.DC cs.PF cs.SY eess.SY 50%

GridPilot: Real-Time Grid-Responsive Control for AI Supercomputers

GridPilot:面向AI超级计算机的实时电网响应控制

Denisa-Andreea Constantinescu, David Atienza

专题命中 越狱攻击 :safety(abstract)

AI总结 提出GridPilot三层预测控制器,在GPU测试台上实现97.2毫秒的端到端电网响应,比北欧快速频率储备要求快6.9倍,并通过PUE感知控制消除冷却开销,证明兆瓦级AI/HPC负载可设计为可控的电网灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17772 2026-05-19 cs.CV 50%

Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework

通过联合多目标和多模型优化框架实现通用物理对抗攻击

Ziyang Liu, Hongyuan Wang, Zijian Wang, Yinxi Lu, Yunzhao Zang, Zhiqiang Yan, Qianhao Ning

机构 * Research Center for Space Optical Engineering, Harbin Institute of Technology(哈尔滨工业大学空间光学工程研究中心) Zhengzhou Research Institute, Harbin Institute of Technology(郑州研究院,哈尔滨工业大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出了一种联合多目标和多模型优化框架(JMOF),通过定量相似性分析选择最优的替代模型集合,以解决物理对抗攻击中单个替代模型过拟合和优化目标的问题,同时通过双层机制平衡攻击效率与深度泛化,并通过正交梯度对齐策略解决跨模型梯度冲突,从而提升攻击效果和跨任务泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15711 2026-05-18 cs.CV 50%

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

EntropyScan: 向通过视觉注意力熵实现LVLMs的模型级后门检测

Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * China University of Geosciences(中国地质大学) University of the Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出EntropyScan,一种轻量且不依赖触发器的模型级后门检测方法,通过量化视觉注意力分布的结构扭曲来检测后门模型,实验显示其在两个LVLM架构和三种高级攻击场景中达到98.5%的F1分数和96.6%的AUC。

Comments 20 pages, 6 figures, 8tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21457 2026-05-14 cs.CR 50%

SoK: Exposing the Generation and Detection Gaps in LLM-Generated Phishing

SoK:揭示大语言模型生成钓鱼攻击的生成与检测差距

Fengchao Chen, Tingmin Wu, Van Nguyen, Carsten Rudolph

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次全面分析大语言模型生成的钓鱼内容,揭示其逃避检测、强调人类认知操控的特点,并指出防御策略与生成方法间的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12565 2026-05-14 cs.CR 50%

Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery

基于身份的对抗提示生成(PCAP):多身份红队测试以提升对抗提示发现

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

专题命中 越狱攻击 :jailbreak(abstract_cn)

AI总结 PCAP通过结合攻击者身份和策略卡进行对抗搜索,提高攻击成功率和提示多样性,增强对抗策略覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11514 2026-05-13 cs.CR 50%

FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems

FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞

Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

专题命中 越狱攻击 :safety(abstract)

AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09889 2026-05-12 cs.MA 50%

Skill Description Deception Attack against Task Routing in Internet of Agents

针对物联网代理中任务路由的技能描述欺骗攻击

Jiayi He, Xiaofeng Luo, Jiawen Kang, Ruichen Zhang, Jianhang Tang, Dong In Kim

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。

Comments Submitted to IEEE Globecom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09397 2026-05-12 cs.CR 50%

BadDLM: Backdooring Diffusion Language Models with Diverse Targets

BadDLM:针对扩散语言模型的多样化目标后门攻击研究

Shengfang Zhai, Xiaoyang Ji, Yuling Shi, Haoran Gao, Fanyu Meng, Yan Zeng, Yuejian Fang, Yinpeng Dong, Jiaheng Zhang

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出BadDLM框架,研究扩散语言模型的后门攻击,通过触发感知训练目标和理论证明,展示其在概念注入、语义属性引导等目标上的有效性,揭示扩散生成中的新安全风险。

Comments 21 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 越狱攻击 :safety(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 50%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 越狱攻击 :alignment(abstract)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 50%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 50%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 越狱攻击 :safety(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24051 2026-04-28 cs.CR 50%

System-aware contextual digital twin for ICS anomaly diagnosis

面向系统的上下文数字孪生用于ICS异常诊断

Eungyu Woo, Yooshin Kim, Wonje Heo, Donghoon Shin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出一种面向系统的无监督框架,结合轻量级在线检测与上下文解释,实现ICS异常诊断的实时检测和可解释诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02450 2026-04-28 cs.CV 50%

GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection

GCP: 带空间-时间感知恶意代理检测的防护协作感知

Yihang Tao, Senkang Hu, Yue Hu, Haonan An, Hangcheng Cao, Yuguang Fang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。

Comments Accepted by IEEE TDSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07527 2026-04-23 cs.CR 50%

Security Modelling for Cyber-Physical Systems: A Systematic Literature Review

面向网络物理系统的安全建模:系统文献综述

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

专题命中 越狱攻击 :safety(abstract)

AI总结 本文系统回顾了网络物理系统安全建模的研究,探讨威胁与攻击建模的区别及其对系统安全的影响,总结现有研究的局限性。

Comments Accepted by ACM Transactions on Cyber-Physical Systems (TCPS)

Journal ref ACM Trans. Cyber Phys. Syst. 10(2), Article 20, 1-29 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV 50%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13308 2026-04-16 cs.CR cs.SY eess.SY 50%

Threat Modeling and Attack Surface Analysis of IoT-Enabled Controlled Environment Agriculture Systems

物联网赋能可控环境农业系统的威胁建模与攻击面分析

Andrii Vakhnovskyi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文首次提出物联网可控环境农业系统的全面威胁模型,识别123种威胁并提出防御框架,揭示AI驱动农业中的新型攻击类别及物理影响。

Comments 11 pages, 1 figure, 5 tables, 48 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06840 2026-04-14 cs.CR 50%

MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning

MirageBackdoor: 一种诱导“思考良好但回答错误”推理的隐蔽攻击

Yizhe Zeng, Wei Zhang, Yunpeng Li, Juxin Xiao, Xiao Wang, Yuling Liu

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出MirageBackdoor攻击,通过解锁模型后输出空间和定制训练流程,使模型在保持清洁推理过程的同时,选择性地将最终答案导向特定目标,显著提升攻击隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08291 2026-04-10 cs.GT cs.CR cs.OS 50%

VCAO: Verifier-Centered Agentic Orchestration for Strategic OS Vulnerability Discovery

VCAO:以验证者为中心的代理协调用于战略操作系统漏洞发现

Suyash Mishra

专题命中 越狱攻击 :safety(abstract)

AI总结 VCAO通过博弈论方法优化操作系统漏洞发现,利用多代理系统在资源约束下实现高效漏洞检测,相比传统方法提升漏洞发现效率并降低误报率。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07291 2026-04-08 cs.CR 50%

Evaluating LLM-based Personal Information Extraction and Countermeasures

评估基于大语言模型的个人信息提取及应对措施

Yupei Liu, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究评估了基于大语言模型的个人信息提取技术及防御策略,通过系统测量研究对比了多种方法的性能,发现大语言模型在提取个人信息上表现优异,但通过提示注入可有效防御其攻击。

Comments USENIX Security Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00446 2026-04-07 cs.CR 50%

Exposing the Ghost in the Transformer: Abnormal Detection for Large Language Models via Hidden State Forensics

揭示Transformer中的幽灵:通过隐藏状态取证实现大语言模型的异常检测

Shide Zhou, Kailong Wang, Ling Shi, Haoyu Wang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 本文提出通过隐藏状态取证检测大语言模型异常行为,实现实时高效的安全威胁识别,检测准确率超95%,计算开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30034 2026-04-01 cs.CR 50%

EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method

EnsembleSHAP:为随机子空间方法提供可信且可验证的属性分配

Yanting Wang, Jinyuan Jia

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 本文提出EnsembleSHAP,为随机子空间方法提供高效且安全的特征属性分配,具备本地准确性并能抵御隐私保护攻击,首次证明了对解释保护攻击的鲁棒性。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20863 2026-03-31 cs.CR 50%

Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks

通过隐藏提示注入攻击误导用于科学同行评审的大型语言模型

Matteo Gioele Collu, Umberto Salviati, Roberto Confalonieri, Mauro Conti, Giovanni Apruzzese

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究探讨了通过隐藏提示注入攻击误导科学同行评审中使用的大型语言模型的潜力,设计了不可见于人类读者但能引导LLM输出的对抗性提示,并评估了其在不同系统和论文中的鲁棒性。

Comments Accepted to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14332 2026-03-23 cs.CR 50%

Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use

动态能力治理:用于AI代理工具使用的加密绑定与可重复性验证

Ziling Zhou

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出三种代理治理要求,通过加密绑定和可重复性验证解决AI代理动态能力验证问题,证明两个结构定理并验证两种加密方案,展示低开销和高安全性。

Comments 23 pages, 5 figures, 18 tables. Includes 11 experiments, 9 formal security properties, and appendix with proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17459 2026-03-19 cs.RO 50%

P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation

P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航

Tianfu Li, Wenbo Chen, Haoxuan Xu, Xinhu Zheng, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 越狱攻击 :alignment(abstract)

AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08897 2026-03-11 cs.CV 50%

Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures

基于VLM的自动驾驶架构中补丁攻击的比较分析

David Fernandez, Pedram MohajerAnsari, Amir Salarpour, Long Cheng, Abolfazl Razi, Mert D. Pesé

机构 * School of Computing, Clemson University(计算机学院,克莱姆森大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文比较了三种基于VLM的自动驾驶架构对物理对抗攻击的鲁棒性,发现所有架构均存在严重漏洞,揭示了不同架构在对抗威胁下的脆弱性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07384 2026-03-10 quant-ph 50%

Machine Learning Techniques for Enhancing Quantum Key Distribution

用于增强量子密钥分配的机器学习技术

Ali Al-Kuwari, Safaa Alqrinawi, Lujayn Al-Amir, Amina Mollazehi, Saif Al-Kuwari

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文综述了机器学习技术在提升量子密钥分配系统安全性和性能方面的应用,涵盖参数优化、攻击检测、协议选择、密钥性能预测和量子网络管理等五个方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02590 2026-03-04 cs.CR 50%

Extending the Formalism and Theoretical Foundations of Cryptography to AI

扩展密码学形式化和理论基础以适应人工智能

Federico Villa, F. Betül Durak, Tadayoshi Kohno, Tapdig Maharramli, Franziska Roesner

专题命中 越狱攻击 :harmlessness(abstract)

AI总结 本文提出了一种基于形式化方法的代理访问控制框架,通过统一保密性、完整性和可用性,解决了现有授权机制缺乏共享基础的问题,并证明了模块化分解在代理系统安全性中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23397 2026-03-02 cs.CR cs.SY eess.SY 50%

Lifecycle-Integrated Security for AI-Cloud Convergence in Cyber-Physical Infrastructure

面向AI-云融合的生命周期集成安全机制:用于网络物理基础设施

S M Zia Ur Rashid, Deepa Gurung, Sonam Raj Gupta, Suman Rath

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出了一种生命周期集成的安全架构,通过综合AI治理、云安全和工业标准,实现对AI-云融合环境中多层攻击的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏