arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2507.02424 2026-02-10 cs.CR cs.AI cs.SE 57%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 57%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 57%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 57%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 57%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03495 2026-01-27 eess.SY cs.AI cs.SY 57%

Cyberattack Detection in Virtualized Microgrids Using LightGBM and Knowledge-Distilled Classifiers

在虚拟微电网中利用LightGBM和知识蒸馏分类器进行网络攻击检测

Osasumwen Cedric Ogiesoba-Eguakun, Suman Rath

机构 * The University of Tulsa(塔尔萨大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于LightGBM和知识蒸馏的轻量级机器学习方法,用于在虚拟微电网中高效检测网络攻击。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21155 2026-01-27 cs.CL 57%

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

学习错误的教训:语言模型中的语法-领域虚假相关性

Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

机构 * Northeastern University(东北大学) MIT(麻省理工学院) Meta

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 研究揭示了语言模型中语法与领域之间的虚假相关性问题,指出训练数据中语法模板可能影响模型性能,并提出需测试此类相关性及确保训练数据多样性以防止错误学习。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 57%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 57%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11020 2026-01-26 cs.CR cs.AI 57%

Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis

医疗AI架构中的数据中毒漏洞:安全威胁分析

Farhad Abtahi, Fernando Seoane, Iván Pau, Mario Vega-Barbas

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 医疗AI面临数据中毒威胁,需多层防御措施和可解释系统以提高安全性。

Journal ref J Med Internet Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15047 2026-01-21 cs.CL 57%

RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search

RainbowPlus:通过进化质量-多样性搜索增强对抗性提示生成

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 RainbowPlus通过进化质量-多样性搜索提升对抗性提示生成,实现更高的攻击成功率和多样性,且运行效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10407 2026-01-16 cs.LG 57%

CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning

CS-GBA:一种基于关键样本的梯度引导后门攻击用于离线强化学习

Yuanjie Zhao, Junnan Qiu, Yue Ding, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 CS-GBA提出了一种基于关键样本的梯度引导后门攻击方法,通过优化攻击预算和隐蔽性,有效对抗安全约束算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06305 2026-01-13 cs.CL 57%

Why LoRA Fails to Forget: Regularized Low-Rank Adaptation Against Backdoors in Language Models

为何LoRA无法遗忘:针对语言模型中的后门行为的正则化低秩适应

Hoang-Chau Luong, Lingwei Chen

机构 * Golisano College of Computing and Information Sciences(戈利萨诺计算与信息科学学院) Rochester Institute of Technology(罗切斯特理工大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 RoRA通过增强谱强度和纠正对齐,有效提升LoRA在对抗后门攻击时的遗忘能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05445 2026-01-12 cs.CR cs.LG 57%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05339 2026-01-12 cs.CR cs.AI 57%

Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models

多轮劫持攻击在多模态大语言模型中的应用

Badhan Chandra Das, Md Tasnim Jawad, Joaquin Molto, M. Hadi Amini, Yanzhao Wu

机构 * Knight Foundation School of Computing and Information Science, Florida International University(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出多轮劫持攻击及FragGuard防御机制,评估其在多模态大语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 57%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01211 2026-01-08 cs.CR cs.AI cs.MA 57%

Web Fraud Attacks Against LLM-Driven Multi-Agent Systems

针对基于大语言模型的多智能体系统 的网络欺诈攻击

Dezhang Kong, Hujin Peng, Yilun Zhang, Lele Zhao, Zhenhua Xu, Shi Lin, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Changsha University of Science and Technology(长沙理工大学) Purdue University(普渡大学) University of California San Diego(加州大学圣地亚哥分校) Zhejiang Gongshang University(浙江工商大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种针对基于大语言模型的多智能体系统的新攻击类型,通过网络链接的独特结构欺骗系统,展示了其在不同架构中的破坏潜力及逃避优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02680 2026-01-07 cs.CR cs.LG 57%

Adversarial Contrastive Learning for LLM Quantization Attacks

对抗对比学习用于大语言模型量化攻击

Dinghong Song, Zhiwei Xu, Hai Wan, Xibin Zhao, Pengfei Su, Dong Li

机构 * Tsinghua University(清华大学) University of California, Merced(加州大学默塞德分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文提出对抗对比学习方法,通过最大化良性与有害响应概率差距,有效提升大语言模型量化攻击的成功率。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18733 2025-12-23 cs.CR cs.AI cs.MA 57%

Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection

通过双层图异常检测实现LLM多智能体系统的可解释性与细粒度防护

Junjun Pan, Yixin Liu, Rui Miao, Kaize Ding, Yu Zheng, Quoc Viet Hung Nguyen, Alan Wee-Chung Liew, Shirui Pan

机构 * School of Information and Communication Technology, Griffith University, Australia(格里菲斯大学信息与通信技术学院) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) Department of Statistics and Data Science, Northwestern University, USA(西北大学统计与数据科学系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出XG-Guard框架,通过双层图异常检测实现对LLM多智能体系统中恶意智能体的可解释性与细粒度检测。

Comments 14 pages, 3 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17041 2025-12-22 cs.AI cs.SY eess.SY 57%

Security Risks of Agentic Vehicles: A Systematic Analysis of Cognitive and Cross-Layer Threats

代理车辆的安全风险:对认知和跨层威胁的系统分析

Ali Eslami, Jiangbo Yu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出基于角色的架构,分析代理车辆中认知和跨层安全威胁,提供首个结构化分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14741 2025-12-18 cs.CR cs.AI 57%

Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs

在LLM持续微调下的持久后门攻击

Jing Cui, Yufei Han, Jianbin Jiao, Junge Zhang

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出P-Trojan算法,研究在LLM持续微调中后门的持久性问题,实验显示其在保持清洁任务准确性的同时实现高持久性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 57%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13703 2025-12-17 cs.CR cs.AI 57%

Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models

Safe2Harm: 语义同构攻击用于大型语言模型的劫持

Fan Yang

机构 * Jinan University(济南大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 Safe2Harm通过语义同构攻击方法,利用合法与有害场景的底层原理一致性,实现高效的大规模语言模型劫持,并提出有害内容评估数据集用于防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11986 2025-12-16 cs.LG 57%

Learning to Extract Context for Context-Aware LLM Inference

学习提取上下文以实现上下文感知的LLM推理

Minseon Kim, Lucas Caccia, Zhengyan Shi, Matheus Pereira, Marc-Alexandre Côté, Xingdi Yuan, Alessandro Sordoni

机构 * Microsoft Research(微软研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出通过提取上下文信息提升LLM推理的安全性,减少有害输出并提高合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 57%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17248 2025-12-16 cs.LG cs.CR 57%

Backdoors in DRL: Four Environments Focusing on In-distribution Triggers

DRL中的后门:聚焦于分布内触发器的四个环境

Chace Ashcraft, Ted Staley, Josh Carney, Cameron Hickert, Derek Juba, Kiran Karra, Nathan Drenkow

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文针对深度强化学习中的后门攻击,通过四个环境探讨分布内触发器的特性与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16989 2025-12-12 cs.LG 57%

Unveiling the Latent Directions of Reflection in Large Language Models

揭示大型语言模型中反思的潜在方向

Fu-Chieh Chang, Yu-Ting Lee, Pei-Yuan Wu

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文通过分析模型激活中的潜在方向,揭示了大型语言模型中反思机制的可控性及不同反思层次的区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14070 2025-11-27 cs.CR cs.AI 57%

Special-Character Adversarial Attacks on Open-Source Language Model

特殊字符对抗攻击对开源语言模型的攻击

Ephraiem Sarabamoun

机构 * University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了针对开源语言模型的特殊字符对抗攻击,评估了多种攻击方式并揭示了模型的安全漏洞及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17987 2025-11-24 cs.CR cs.AI cs.CV 57%

Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning

通过LLM推理进行文本到图像模型的劫持:Reason2Attack

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, An-An Liu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 Reason2Attack通过将劫持攻击融入LLM后训练过程,提升生成对抗性提示的推理能力,实现更高效的文本到图像模型攻击

Comments Noted that This paper includes model-generated content that may contain offensive or distressing material

详情

展开后加载摘要…

URL PDF HTML 收藏