arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-27 至 2026-07-27 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2607.21619 2026-07-27 cs.CL cs.AI 新提交 79%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23849 2026-07-27 cs.CR cs.AI cs.DC cs.LG 版本更新 62%

Security Without Detection: Economic Denial as a Primitive for Edge and IoT Defense

无需检测的安全:经济否认作为边缘和物联网防御的基本原理

Samaresh Kumar Singh, Joyjit Roy, Sriharsha Anand Pushkala

机构 * st Samaresh Kumar Singh(第一作者机构) nd Joyjit Roy(第二作者机构)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EDS是一种不依赖检测的物联网和边缘安全方法,通过经济成本放大机制有效遏制攻击,实现超线性成本增加和高缓解率。

Comments 8 pages, 2 figures, submitted to 3rd International Conference on Intelligent Digitization of Systems and Services (IDSS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏