arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2603.12681 2026-03-31 cs.CR cs.LG 88%

Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment

协同LoRA:大语言模型安全对齐中的组合性漏洞

Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。

Comments Updated manuscript to better reflect the core contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 78%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 越狱攻击 :safety(title,abstract)

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 70%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 62%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20863 2026-03-31 cs.CR 50%

Misleading Large Language Models used (or misused) in Scientific Peer-Reviewing via Hidden Prompt-Injection Attacks

通过隐藏提示注入攻击误导用于科学同行评审的大型语言模型

Matteo Gioele Collu, Umberto Salviati, Roberto Confalonieri, Mauro Conti, Giovanni Apruzzese

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 研究探讨了通过隐藏提示注入攻击误导科学同行评审中使用的大型语言模型的潜力,设计了不可见于人类读者但能引导LLM输出的对抗性提示,并评估了其在不同系统和论文中的鲁棒性。

Comments Accepted to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏