arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2604.12616 2026-08-19 cs.AI cs.MM 版本更新 90%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17556 2026-08-19 cs.CR cs.CL cs.LG 新提交 84%

Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings

Reflex-Guard:一种使用稠密语义嵌入的低延迟大语言模型提示安全护栏

Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon, Abu-fuad Ahmad, Thi Hong Tran

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 Reflex-Guard是一种本地运行的轻量型LLM提示安全护栏,采用稠密语义嵌入与快速分类器,延迟低至37.6毫秒,召回率达95.9%,性能优于现有基线,可高效检测各类越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17234 2026-08-19 cs.CR cs.AI 新提交 83%

COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models

COMIC:面向多模态大语言模型的参考感知安全门控

Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17360 2026-08-19 cs.CR cs.AI 新提交 70%

Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets

Fair ASR:在共享目标调用预算下重新评估黑盒越狱攻击

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出Fair-ASR评估协议,重新评估11种黑盒越狱攻击,发现攻击排名随预算变化,进而提出ReCode攻击,在20次目标调用预算下于GPT-5实现85% ASR且效率优异。

Comments 29 pages, 8 figures, 13 tables. Code: this https URL (https://github.com/xsddys/Fair-ASR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17275 2026-08-19 cs.CR cs.AI 新提交 57%

When Agents Act on Web3: An Attack-Surface Survey of MCP, Skills, and Tool Calling

当智能体在Web3中行动:MCP、技能与工具调用的攻击面调查

Rabimba Karanjai, Yang Lu, Nour Diallo, Wujie Xiong, Lei Xu, Weidong (Larry)Shi

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本调查针对智能体通过MCP等在Web3区块链上行动的攻击面,构建风险映射矩阵,发现现有防护不足,推导了相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏