arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3242 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3242 篇

2506.18931 2025-06-25 cs.LG cs.AI 88%

Safe Pruning LoRA: Robust Distance-Guided Pruning for Safety Alignment in Adaptation of LLMs

Shuang Ao, Yi Dong, Jinwei Hu, Sarvapali Ramchurn

机构 * School of Electronics and Computer Science, University of Southampton, UK(索姆塞特大学电子与计算机科学学院) Department of Computer Science, University of Liverpool, UK(利弗pool大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10020 2025-06-13 cs.CR cs.AI cs.CL 88%

From Threat to Tool: Leveraging Refusal-Aware Injection Attacks for Safety Alignment

Kyubyung Chae, Hyunbin Jin, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18526 2025-04-04 cs.AI cs.LG 88%

NeuroAI for AI Safety

Patrick Mineault, Niccolò Zanichelli, Joanne Zichen Peng, Anton Arkhipov, Eli Bingham, Julian Jara-Ettinger, Emily Mackevicius, Adam Marblestone, Marcelo Mattar, Andrew Payne, Sophia Sanborn, Karen Schroeder, Zenna Tavares, Andreas Tolias, Anthony Zador

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.LG

Comments 152 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04744 2025-03-10 cs.CY cs.AI 88%

Safety Cases: A Scalable Approach to Frontier AI Safety

Benjamin Hilton, Marie Davidsen Buhl, Tomek Korbak, Geoffrey Irving

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 18 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15279 2025-02-18 cs.AI cs.CL 88%

Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model

Siyin Wang, Xingsong Ye, Qinyuan Cheng, Junwen Duan, Shimin Li, Jinlan Fu, Xipeng Qiu, Xuanjing Huang

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08657 2025-02-14 cs.CL cs.AI 88%

Refining Positive and Toxic Samples for Dual Safety Self-Alignment of LLMs with Minimal Human Interventions

Jingxin Xu, Guoshun Nan, Sheng Guan, Sicong Leng, Yilian Liu, Zixiao Wang, Yuyang Ma, Zhili Zhou, Yanzhao Hou, Xiaofeng Tao

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13302 2025-01-24 cs.CL cs.AI 88%

Watching the AI Watchdogs: A Fairness and Robustness Analysis of AI Safety Moderation Classifiers

Akshit Achara, Anshuman Chhabra

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12321 2023-10-04 cs.CY cs.AI 88%

A Case for AI Safety via Law

Jeffrey W. Johnston

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.09883 2017-11-29 cs.LG cs.AI 88%

AI Safety Gridworlds

Jan Leike, Miljan Martic, Victoria Krakovna, Pedro A. Ortega, Tom Everitt, Andrew Lefrancq, Laurent Orseau, Shane Legg

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12274 2024-12-17 cs.CL 88%

SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models

Somnath Banerjee, Sayan Layek, Soham Tripathy, Shanu Kumar, Animesh Mukherjee, Rima Hazra

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments Accepted at AAAI 2025 (AI Alignment Track). Also selected for Microsoft Academic Partnership Grant (MAPG) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11801 2024-10-29 cs.CL 88%

Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations

Rima Hazra, Sayan Layek, Somnath Banerjee, Soujanya Poria

专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.CL

Comments EMNLP 2024 Main. Codes are available at: https://github.com/declare-lab/safety-arithmetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15717 2026-04-20 cs.CR 88%

Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries

进入灰色区域:领域上下文可以模糊大语言模型安全边界

Ki Sen Hung, Xi Yang, Chang Liu, Haoran Li, Kejiang Chen, Changxuan Fan, Tsun On Kwok, Weiming Zhang, Xiaomeng Li, Yangqiu Song

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);harmlessness(abstract)

AI总结 研究探讨了领域上下文如何模糊大语言模型的安全边界,提出Jargon框架通过多轮对抗交互提升攻击成功率,通过激活空间分析揭示灰色区域的不可靠性,并设计政策引导的防护策略以减少攻击成功率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11049 2024-10-22 cs.LG cs.AI cs.CL 88%

Stepwise Alignment for Constrained Language Model Policy Optimization

Akifumi Wachi, Thien Q. Tran, Rei Sato, Takumi Tanabe, Youhei Akimoto

专题命中 安全训练 :alignment(title,abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

Comments Accepted at NeurIPS 2024. Code and models are available at https://github.com/line/sacpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11583 2026-08-13 cs.AI 新提交 88%

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05409 2026-08-07 cs.CL 新提交 88%

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

情绪很重要:句法敏感性如何破坏安全对齐

Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt, Simone Paolo Ponzetto

机构 * University of Mannheim(曼海姆大学) Technical University Clausthal(克劳斯塔尔工业大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02674 2026-08-05 cs.CR cs.AI 新提交 88%

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

移动安全屏障:针对白盒攻击的动态路由自适应对齐

Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对大型基础模型易受路由级白盒攻击的问题,提出动态路由自适应对齐框架,通过引入动态补偿路由提升模型安全稳健性且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01414 2026-08-04 cs.AI cs.CR 新提交 88%

No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

无单一失效神经元:针对白盒攻击的分布式安全对齐

Simiao Xie, Chuancheng Shi, Shangze Li, Wenhua Wu, Fei Shen, Ying Zhou, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05518 2026-07-23 cs.CR cs.AI 版本更新 88%

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

概率匹配排名实现真正深度的安全对齐

Jason Vega, Gagandeep Singh

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究开源大语言模型安全问题,针对预填充攻击及相关防御,提出排名辅助预填充(RAP)攻击,又通过匹配令牌排名提出PRESTO方法,提升了模型在RAP攻击下的安全性,为安全开源模型发展助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03533 2026-07-10 cs.AI 88%

Automated Analysis of Global AI Safety Initiatives: A Taxonomy-Driven LLM Approach

全球人工智能安全举措的自动化分析:基于分类学的LLM方法

Takayuki Semitsu, Naoto Kiribuchi, Kengo Zenitani

机构 * Japan AI Safety Institute(日本人工智能安全研究所)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出一种自动化框架,通过共享活动分类法比较AI安全政策文件,利用活动地图上的活动类别提取并映射相关活动,生成摘要、比较和相似度评分,评估LLM在政策文档中的稳定性与有效性。

Comments 18 pages, 6 figures, 6 tables, to be published in PoliticalNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00572 2026-07-09 cs.AI cs.CR 新提交 88%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02714 2026-07-08 cs.CR cs.AI 新提交 88%

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale

并非所有拒绝都是等同的:安全对齐如何在大规模情况下使网络安全失败

Vadym Hadetskyi, Dario Pasquini, Artem Sorokin

机构 * Cracken AI

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究安全对齐在网络安全领域的问题,通过对24个开源语言模型的实验,以Kimi K2为例展示特定领域删减可行,探讨模型特征与删减效果的关联并分类模型,提出相关猜想。

Comments 14 pages, 11 figures. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02914 2026-07-07 cs.AI 新提交 88%

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

Oyster-II:大语言模型中用于建设性安全对齐的强化学习

Jiyang Guan, Yong Xie, Jun Chen, Jiexi Liu, Zipeng Ye, Defeng Li, Jiayu Shen, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI 88%

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25442 2026-06-25 cs.CL 新提交 88%

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

PolicyAlign: 大型语言模型的直接基于策略的安全对齐

Chang Wu, Junfeng Fang, Houcheng Jiang, Kai Tang, Pengyu Cheng, Xiaoxi Jiang, Guanjun Jiang, Xiang Wang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 提出PolicyAlign框架,通过合成违规指令和策略敏感过滤,直接根据自然语言安全策略对齐LLM,提升安全性并保持低过度拒绝和通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07709 2026-06-05 cs.AI cs.CL cs.CY cs.LG 88%

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures

IatroBench: AI安全措施中意外伤害的预注册证据

David Gringras

机构 * Harvard T.H. Chan School of Public Health(哈佛大学T.H. 洪学校公共卫生学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究通过IatroBench评估了AI安全措施在医疗决策中的意外伤害风险,发现不同模型在身份相关性上的隐瞒行为存在显著差异,尤其在高度安全训练的模型中表现更明显。

Comments 30 pages, 3 figures, 11 tables. Pre-registered on OSF (DOI: 10.17605/OSF.IO/G6VMZ). Code and data: https://github.com/davidgringras/iatrobench. v2: Fix bibliography entries (add arXiv IDs, published venues); correct p-value typo in Limitations section; add AI Assistance Statement v3: Correct Figure 1 (decoupling scatter accidentally reverted to earlier draft in v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04168 2026-06-04 cs.LG cs.CR 88%

When Autoregressive Consistency Hurts Safety Alignment

当自回归一致性损害安全对齐

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu

机构 * University of Southampton(索姆塞特大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过分析自回归一致性机制,揭示了大语言模型安全对齐的浅层性,并提出随机插入攻击和对抗性安全对齐方法。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00686 2026-06-02 cs.LG 88%

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

对齐的辩证法:利用不安全知识实现动态安全路由

Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24154 2026-05-26 cs.AI cs.SE 88%

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

Palette: 一种模块化、可控且高效的框架,用于按需授权安全对齐放松的LLMs

Qitao Tan, Xiaoying Song, Arman Akbari, Arash Akbari, Yanzhi Wang, Xiaoming Zhai, Lingzi Hong, Zhen Xiang, Jin Lu, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出Palette框架,通过多目标搜索识别拒绝方向并轻量级适配模型,实现按需放松授权领域的安全拒绝行为,同时保持其他区域的标准安全,支持模块化组合多领域授权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19722 2026-05-20 cs.CR cs.AI 88%

Measuring Safety Alignment Effects in Autonomous Security Agents

在自主安全代理中测量安全对齐效应

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的基准测试,用于评估安全代理在执行漏洞分析任务时的安全对齐效果,发现安全代理的性能差异主要体现在拒绝、不安全行为和工具可靠性等方面,而非单纯的拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI 88%

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏