arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2601.03416 2026-04-17 cs.CV 85%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10846 2026-04-17 cs.LG cs.CR 79%

AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models

AutoRAN:大型推理模型中安全推理的自动化劫持

Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Penn State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.LG

AI总结 AutoRAN通过执行模拟方法,利用较弱但对齐差的模型模拟初始劫持尝试,并通过目标LRM的拒绝泄露的推理模式迭代优化攻击,从而绕过安全防护并扩展有害指令。

Comments 10 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04930 2026-04-17 cs.CR cs.AI 79%

Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring

攻击选择降低集中AI控制设置中对可信监控的安全性

Joachim Schaeffer, Arjun Khandelwal, Tyler Tracy

机构 * Pivotal Research(Pivotal研究) University of Oxford(牛津大学) Redwood Research(Redwood研究)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究攻击选择如何通过映射攻击到质量评分和提交概率影响安全性能,发现FPR对安全影响更大,提示需谨慎评估模型攻击能力以避免安全评分过高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11623 2026-04-17 cs.AI cs.SE 57%

Context Kubernetes: Declarative Orchestration of Enterprise Knowledge for Agentic AI Systems

上下文Kubernetes:面向代理AI系统的企业知识声明式编排

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(开放技术研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Context Kubernetes架构,通过声明式知识架构-as-code和三层权限模型,解决企业知识在代理AI系统中的安全编排问题,实验表明其在治理和安全性方面优于传统方法。

Comments 24 pages, 8 tables, 1 figure, 8 experiments (5 correctness + 3 value). Open-source prototype: https://github.com/Cohorte-ai/context-kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏