arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2408.07663 2024-12-20 cs.CL cs.AI 86%

Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions

Quan Liu, Zhenhong Zhou, Longzhu He, Yi Liu, Wei Zhang, Sen Su

专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024, 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08706 2023-11-16 cs.CY cs.AI 86%

Aligned: A Platform-based Process for Alignment

Ethan Shaotran, Ido Pesok, Sam Jones, Emi Liu

专题命中 安全训练 :alignment(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

Comments 11 pages, 7 figures. For associated public report, see https://energize.ai/openai

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05453 2023-03-10 cs.CL cs.CY 86%

Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback

Hannah Rose Kirk, Bertie Vidgen, Paul Röttger, Scott A. Hale

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.CY

Comments 19 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 86%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 安全训练 :safety(title);AI safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11530 2023-06-21 cs.HC 86%

Intersectionality in Conversational AI Safety: How Bayesian Multilevel Models Help Understand Diverse Perceptions of Safety

Christopher M. Homan, Greg Serapio-Garcia, Lora Aroyo, Mark Diaz, Alicia Parrish, Vinodkumar Prabhakaran, Alex S. Taylor, Ding Wang

专题命中 安全训练 :safety(title,abstract);AI safety(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04263 2022-01-13 cs.HC 86%

The Human Factor in AI Safety

Morteza Saberi

专题命中 安全训练 :safety(title,abstract);AI safety(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14392 2026-08-17 cs.AI 新提交 85%

Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons

Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08471 2026-08-11 cs.AI 新提交 85%

Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production

昨日之盾,今日之矛:生产环境中的自演进安全护栏

Cong Ming, Jingyi Chen, Bin Liu, Qi Chu, Tao Gong, Nenghai Yu, Yingfei Xiang

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Sangfor Technologies(深信服科技)

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对静态LLM安全护栏无法应对新威胁的问题,提出自演进安全护栏SESG多智能体系统,可快速适配新威胁,性能优于静态护栏及自适应基线,已应用于深信服护栏并取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08883 2026-07-13 cs.LG 新提交 85%

Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal

针对安全表示的优化:激活引导的对抗后缀与拒绝几何

Ege Çakar, Hannah Guan, Kayden Kehe

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型安全表示,引入激活引导的对抗后缀攻击方法,如Activation-Guided GCG和Soft-GCG,发现安全表示分布特点,不同规模模型的抗性不同,结果阐明安全机制编码及破解方式,为设计对齐策略提供指导。

Comments Accepted at the AAAI 2026 Summer Symposium Series. This paper was presented at the ICLR Re-Align workshop under a different name, "Accelerating Adversarial Suffix Optimization via Continuous Relaxation and Activation-Guided Objectives"

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13510 2026-05-26 cs.CY 85%

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions

Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CY

AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11242 2026-05-26 cs.CY 85%

LLMs and Childhood Safety: Identifying Risks and Proposing a Protection Framework for Safe Child-LLM Interaction

大语言模型与儿童安全:识别风险并提出安全的儿童-大语言模型交互保护框架

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CY

AI总结 通过系统文献综述识别儿童与大语言模型交互的风险,并基于不同证据流比较提出包含内容安全、发展敏感性和对抗性滥用控制的保护框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21834 2026-05-22 cs.LG 85%

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20129 2026-05-12 cs.CR cs.AI 85%

SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models

SAID: 通过前缀探测实现大型语言模型的安全意识意图防御

Yulong Chen, Qi Zhang, Jiawen Zhang, Yadong Liu, Mu Li, Jie Wen, Yong Xu

机构 * Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology, Harbin Institute of Technology, Shenzhen, Shenzhen, China(深圳视觉目标检测与识别重点实验室,哈尔滨工业大学,哈尔滨工业大学,深圳,深圳,中国)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SAID框架,通过意图层面的安全探测实现无训练的对抗防御,通过核心意图提炼和安全前缀探测减少有害响应,同时保持良性任务的实用性。

Comments 12 pages, 5 figures. V2: Updated title, author list, and extensive experiments; expanded background on LLM security applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05179 2026-04-08 cs.CL 85%

Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering

梯度控制解码:一种用于LLMs的安全防护机制,具有双锚点引导

Purva Chiniya, Kevin Scaria, Sagar Chaturvedi

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出梯度控制解码(GCD),通过双锚点令牌提升安全性,降低误报率,同时在多个基准测试中有效抑制攻击,且对计算资源要求低。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08104 2026-03-24 cs.LG 85%

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

不可见的安全威胁:通过隐写术对LLM进行恶意微调

Guangnian Wan, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02635 2026-03-04 cs.LG 85%

SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety

SaFeR-ToolKit: 通过虚拟工具调用实现多模态安全的结构化推理

Zixuan Xu, Tiancheng He, Huahui Yi, Kun Wang, Xi Chen, Gongli Xi, Qiankun Li, Kang Li, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Hospital, Sichuan University(四川大学华西医院) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 SaFeR-ToolKit通过虚拟工具调用实现多模态安全的结构化推理,提升安全性、帮助性和推理严谨性,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16977 2026-02-20 cs.LG cs.CR 85%

Fail-Closed Alignment for Large Language Models

大型语言模型的Fail-Closed对齐

Zachary Coalson, Beth Sohler, Aiden Gabriel, Sanghyun Hong

机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13234 2026-02-17 cs.AI 85%

Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents

保持角色,保持安全:双循环对抗自进化用于安全角色扮演代理

Mingyang Liao, Yichen Wan, shuchen wu, Chenxi Miao, Xin Shen, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出双循环对抗自进化框架,通过角色扮演防御机制提升安全性和角色忠实度,实验表明在多个大语言模型上有效提升角色扮演的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19180 2026-01-29 cs.CR cs.AI 85%

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03005 2026-01-07 cs.CR cs.AI 85%

JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification

JPU: 通过在线策略路径校正弥合对抗防御与遗忘

Xi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Zhaoye Li, Bin Ji, Baosheng Wang, Jie Yu

机构 * National University of Defense Technology(国防科技大学)

专题命中 安全训练 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 JPU通过动态挖掘在线策略对抗样本,校正动态对抗路径以提升模型对抗攻击的鲁棒性。

Comments 14 pages, 6 figures, under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24263 2026-01-01 cs.AI 85%

Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment

通过风险感知的逐步对齐实现约束语言模型策略优化

Lijun Zhang, Lin Li, Wei Wei, Yajie Qi, Huizhong Song, Jun Wang, Yaodong Yang, Jiye Liang

机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) University College London(伦敦大学学院) Institute for AI, Peking University(北京大学人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21718 2025-12-01 cs.CL 85%

When Harmless Words Harm: A New Threat to LLM Safety via Conceptual Triggers

有害词语的危害:通过概念触发器对LLM安全性的新威胁

Zhaoxin Zhang, Borui Chen, Yiming Hu, Youyang Qu, Tianqing Zhu, Longxiang Gao

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出MICM方法,通过概念触发器针对LLM的价值结构进行劫持,揭示了现有安全机制对隐含价值观操控的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05021 2025-10-01 cs.CL cs.CR 85%

Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety

Yuyou Zhang, Miao Li, William Han, Yihang Yao, Zhepeng Cen, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02063 2025-08-05 cs.AI 85%

TRACEALIGN -- Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs

Amitava Das, Vinija Jain, Aman Chadha

专题命中 安全训练 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05389 2025-06-09 q-bio.NC cs.CY 85%

Rational Superautotrophic Diplomacy (SupraAD); A Conceptual Framework for Alignment Based on Interdisciplinary Findings on the Fundamentals of Cognition

Andrea Morris

专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CY

Comments 64 pages, 2 charts, 3 images, includes formalizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11866 2025-05-20 cs.AI 85%

Position Paper: Bounded Alignment: What (Not) To Expect From AGI Agents

Ali A. Minai

机构 * Senior Member IEEE Dept. of Electrical and Computer Engineering University of Cincinnati(电气与计算机工程系 华盛顿大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

Comments Paper accepted for the 2025 IEEE/INNS International Joint Conference on Neural Networks, Rome, Italy, June 30 - July 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10668 2024-08-27 cs.CR cs.AI 85%

Probing the Safety Response Boundary of Large Language Models via Unsafe Decoding Path Generation

Haoyu Wang, Bingzhe Wu, Yatao Bian, Yongzhe Chang, Xueqian Wang, Peilin Zhao

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02483 2023-07-06 cs.LG cs.CR 85%

Jailbroken: How Does LLM Safety Training Fail?

Alexander Wei, Nika Haghtalab, Jacob Steinhardt

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);harmlessness(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04385 2026-06-30 cs.CL cs.AI cs.LG 85%

How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models

对齐路由:在语言模型中本地化、扩展和控制策略电路

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。

Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2025-12-17 cs.LG cs.AI cs.CL 85%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 16 pages, 7 figures, 9 tables. Code and data available at https://github.com/erikl2/safety-refusal-stability

详情

展开后加载摘要…

URL PDF HTML 收藏