Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 10 pages, 6 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 10 pages, 6 figures
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
专题命中 越狱攻击 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Equal contribution from first two authors. 19 pages, 5 figures. Our code is available at: https://github.com/Vaidehi99/InfoDeletionAttacks
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Serious errors were found in the experiment, which may lead to the overturning of the overall conclusions of the paper
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
强化学习迈向广泛且持久有益的模型
机构 * OpenAI
专题命中 越狱攻击 :alignment(abstract,comments);分类 cs.CL、cs.AI
AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。
Comments Blog: https://alignment.openai.com/beneficial-rl/
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 越狱攻击 :safety(abstract,comments);分类 cs.AI、cs.CY
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI;safety(comments)
Comments ML Safety Workshop NeurIPS 2022
学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准
通过非局部性测量SAE特征的语义抽象性
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。
Comments 18 pages, 9 figures
基因型触发器:通过生成抗菌肽模型中宿主特定后门暴露药物基因组学盲区
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出基因型触发器后门攻击,操控抗菌肽生成模型使其针对特定HLA等位基因携带者生成高免疫原性风险肽,同时保留抗菌效力与低毒性,以暴露药物基因组学盲区。
AI安全排行榜:方法、结果与最低标准
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。
时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。
Comments 6 pages, 2 figures, IEEE CAI
QShield: 通过量子电路安全神经网络对抗对抗性攻击
机构 * Emory University(埃默里大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 QShield通过结合传统CNN和量子处理模块,提升经典深度学习模型的对抗鲁棒性,实验表明其在多种数据集上有效降低攻击成功率并提高预测准确性。
通过表示引导在视觉语言模型供应链中植入架构后门
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。
Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证
机构 * Gubernaut Research(Gubernaut研究)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。
Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)
无需检测的安全:经济否认作为边缘和物联网防御的基本原理
机构 * st Samaresh Kumar Singh(第一作者机构) ; nd Joyjit Roy(第二作者机构)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 EDS是一种不依赖检测的物联网和边缘安全方法,通过经济成本放大机制有效遏制攻击,实现超线性成本增加和高缓解率。
Comments 8 pages, 2 figures, submitted to 3rd International Conference on Intelligent Digitization of Systems and Services (IDSS2026)
CHERRY: 具有循环表示收益的压缩层次专家
机构 * TeamSparta Inc.(TeamSparta公司)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。
Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history
通过共享表示攻击图基础模型
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究通过攻击图基础模型的共享表示来探索其脆弱性,采用表示空间扰动和输入空间攻击等方法,针对六个公共模型进行实验,发现不同模型的脆弱性表现,如OpenGraph的频谱分词器有特定脆弱性,还分析了脆弱性与解码器读取表示的关系。
隐藏在思维中:可转移的思维链工件引发有害行为
机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) ; Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG
AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。
多智能体人工智能控制:分布式攻击阻碍实例级监测
机构 * MATS Research(MATS研究所)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究多智能体人工智能控制中的分布式攻击,开发FakeLab代码库,评估单智能体监测应对分布式攻击的效果,发现碎片化效应,指出其与代码比例无关,受模型能力影响,还揭示显式规划器及不同强度监测的作用。
Comments Submitted to NeurIPS; 81 pages; 32 figures and 24 tables
分离性身份:语言模型代理缺乏声誉机制的基础
机构 * University of Oxford(牛津大学) ; New York University Shanghai(纽约大学上海分校)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。
Comments Accepted by FaccT 2026
一年后...伤害持续,但我们仍在!
机构 * Northeastern University(东北大学) ; Florida International University(佛罗里达国际大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。
Comments 20 pages, 8 tables
Anthropic Fable 5 与 Opus 4.8 模型的红队研究
机构 * AI4I
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。
Comments White paper
无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究
机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。
Comments 33 pages, 4 figures, 8 tables