Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024, 15 pages, 5 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024, 15 pages, 5 figures
专题命中 安全训练 :alignment(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Comments 11 pages, 7 figures. For associated public report, see https://energize.ai/openai
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.CY
Comments 19 pages, 1 table
OMNIGUARD:一种跨语言和模态的高效AI安全审查方法
机构 * University of Washington(华盛顿大学) ; Microsoft(微软公司)
专题命中 安全训练 :safety(title);AI safety(title);分类 cs.CL、cs.AI、cs.LG
AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。
专题命中 安全训练 :safety(title,abstract);AI safety(title)
专题命中 安全训练 :safety(title,abstract);AI safety(title)
Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。
昨日之盾,今日之矛:生产环境中的自演进安全护栏
机构 * University of Science and Technology of China(中国科学技术大学) ; Shenzhen University(深圳大学) ; Sangfor Technologies(深信服科技)
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对静态LLM安全护栏无法应对新威胁的问题,提出自演进安全护栏SESG多智能体系统,可快速适配新威胁,性能优于静态护栏及自适应基线,已应用于深信服护栏并取得良好效果。
针对安全表示的优化:激活引导的对抗后缀与拒绝几何
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究大语言模型安全表示,引入激活引导的对抗后缀攻击方法,如Activation-Guided GCG和Soft-GCG,发现安全表示分布特点,不同规模模型的抗性不同,结果阐明安全机制编码及破解方式,为设计对齐策略提供指导。
Comments Accepted at the AAAI 2026 Summer Symposium Series. This paper was presented at the ICLR Re-Align workshop under a different name, "Accelerating Adversarial Suffix Optimization via Continuous Relaxation and Activation-Guided Objectives"
Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CY
AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。
大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CY
AI总结 通过系统文献综述识别儿童与大语言模型交互的风险,并基于不同证据流比较提出包含内容安全、发展敏感性和对抗性滥用控制的保护框架。
基于策略的一致性训练通过最小能力退化提升大语言模型安全性
机构 * New York University(纽约大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。
SAID: 通过前缀探测实现大型语言模型的安全意识意图防御
机构 * Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology, Harbin Institute of Technology, Shenzhen, Shenzhen, China(深圳视觉目标检测与识别重点实验室,哈尔滨工业大学,哈尔滨工业大学,深圳,深圳,中国)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出SAID框架,通过意图层面的安全探测实现无训练的对抗防御,通过核心意图提炼和安全前缀探测减少有害响应,同时保持良性任务的实用性。
Comments 12 pages, 5 figures. V2: Updated title, author list, and extensive experiments; expanded background on LLM security applications
梯度控制解码:一种用于LLMs的安全防护机制,具有双锚点引导
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL
AI总结 本文提出梯度控制解码(GCD),通过双锚点令牌提升安全性,降低误报率,同时在多个基准测试中有效抑制攻击,且对计算资源要求低。
Comments Accepted at LREC2026
不可见的安全威胁:通过隐写术对LLM进行恶意微调
机构 * National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.LG
AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。
Comments Accepted at ICLR 2026
SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; West China Hospital, Sichuan University(四川大学华西医院) ; Nanyang Technological University(南洋理工大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.LG
AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。
大型语言模型的Fail-Closed对齐
机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。
Comments Pre-print
保持角色,保持安全:双循环对抗自进化用于安全角色扮演代理
机构 * Baidu Inc.(百度公司) ; The University of Queensland(昆士兰大学) ; Peking University(北京大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出双循环对抗自进化框架,通过角色扮演防御机制提升安全性和角色忠实度,实验表明在多个大语言模型上有效提升角色扮演的稳定性与安全性。
通过主动安全推理增强模型对劫持的防御
机构 * School of Computing(计算学院) ; National University of Singapore(新加坡国立大学) ; School of Computer Science and Engineering(计算机科学与工程学院) ; Nanyang Technological University(南洋理工大学) ; Department of Computing(计算系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。
JPU: 通过在线策略路径校正弥合对抗防御与遗忘
机构 * National University of Defense Technology(国防科技大学)
专题命中 安全训练 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 JPU通过动态挖掘在线策略对抗样本,校正动态对抗路径以提升模型对抗攻击的鲁棒性。
Comments 14 pages, 6 figures, under review;
通过风险感知的逐步对齐实现约束语言模型策略优化
机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) ; University College London(伦敦大学学院) ; Institute for AI, Peking University(北京大学人工智能研究院)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。
有害词语的危害:通过概念触发器对LLM安全性的新威胁
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
Comments ACL 2025 Findings
专题命中 安全训练 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI
专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CY
Comments 64 pages, 2 charts, 3 images, includes formalizations
机构 * Senior Member IEEE Dept. of Electrical and Computer Engineering University of Cincinnati(电气与计算机工程系 华盛顿大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI
Comments Paper accepted for the 2025 IEEE/INNS International Joint Conference on Neural Networks, Rome, Italy, June 30 - July 5, 2025
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);harmlessness(abstract);分类 cs.LG
对齐路由:在语言模型中本地化、扩展和控制策略电路
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。
Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026
安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。
Comments 16 pages, 7 figures, 9 tables. Code and data available at https://github.com/erikl2/safety-refusal-stability