arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-26 至 2026-06-26 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2606.25487 2026-06-26 cs.CL cs.CR cs.LG 新提交 84%

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

你的越狱评判有多可靠?自动ASR评分的校准与对抗鲁棒性

Yang Gao

机构 * Veyon Solutions

专题命中 越狱攻击 :jailbreak(title);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了LLM越狱攻击成功率(ASR)的自动评判器(安全分类器与LLM评判)的可靠性,发现两者存在相反缺陷,且易受攻击,建议报告评判器的精确率和召回率并校正ASR。

Comments 10 pages, 3 figures, 2 tables, Code: github.com/gy15901580825/judgeflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27231 2026-06-26 quant-ph physics.ins-det 新提交 78%

A hardware-safety-gated system for LLM-written native ARTIQ control code on a trapped-ion platform

基于硬件安全门控的LLM编写原生ARTIQ控制代码系统在离子阱平台上的应用

Duanyang Wang, Lu Qi, Yuanheng Xie, Norbert M. Linke, Kenneth R. Brown

专题命中 越狱攻击 :safety(title,abstract)

AI总结 提出一种硬件安全门控系统,通过令牌授权机制确保LLM代理在离子阱实验中安全自主地编写和执行控制代码,并在实验中验证了其有效性和可移植性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26936 2026-06-26 cs.CR cs.CL cs.LG 新提交 73%

Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

普通人的越狱:通过多臂老虎机算法选择最优越狱以自动增强查询

Prarabdh Shukla, Ritik, Suhas Rao, Arpit Agarwal, Arjun Bhagoji

机构 * Centre for Machine Intelligence and Data Science, IIT Bombay(印度理工学院班加罗尔机器智能与数据科学中心) Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔计算机科学与工程系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 提出基于多臂老虎机框架的越狱攻击策略,在线学习最优越狱方法,并构建包含11,279个恶意查询的安全基准FrankensteinBench,实验表明对15个开源LLM平均成功率高达97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26377 2026-06-26 cs.CR 新提交 50%

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

验证意图与危害:针对LLM生成威胁的统一防御

Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏