arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3242 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3242 篇

2510.09004 2025-10-13 cs.CL 89%

Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models

Yutao Mou, Xiaoling Zhou, Yuxiao Luo, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);trustworthy(abstract);分类 cs.CL

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08270 2025-07-14 cs.AI cs.CR 89%

Agent Safety Alignment via Reinforcement Learning

Zeyang Sha, Hanling Tian, Zhuoer Xu, Shiwen Cui, Changhua Meng, Weiqiang Wang

机构 * Ant Group(蚂蚁集团)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04778 2026-06-04 cs.AI cs.CL cs.LG 89%

Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

超越浅层安全的推理时脆弱性:沿生成轨迹的对齐

Kyungmin Park, Taesup Kim

机构 * Hankuk University of Foreign Studies(翰江大学外国语大学) Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示安全对齐的大语言模型在推理时存在更广泛的脆弱性,即任意生成步骤的短标记注入都能显著改变后续安全行为,并提出通过直接在生成轨迹上对齐模型来提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29801 2026-05-29 cs.AI cs.CL cs.CR cs.CV cs.LG 89%

AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security

AgentDoG 1.5:一种轻量级且可扩展的AI智能体安全与安保对齐框架

Dongrui Liu, Yu Li, Zhonghao Yang, Peng Wang, Guanxu Chen, Yuejin Xie, Qinghua Mao, Wanying Qu, Yanxu Zhu, Tianyi Zhou, Leitao Yuan, Zhijie Zheng, Qihao Lin, Yimin Wang, Haoyu Luo, Shuai Shao, Chen Qian, Qingyu Liu, Ling Tang, Ruiyang Qin, Qihan Ren, Junxiao Yang, Kun Wang, Zhiheng Xi, Linfeng Zhang, Ranjie Duan, Bo Zhang, Wenjie Wang, Wen Shen, Qiaosheng Zhang, Yan Teng, Chaochao Lu, Rui Mei, Man Li, Jialing Tao, Xi Lin, Tianhang Zheng, Yong Liu, Quanshi Zhang, Lei Zhu, Xingjun Ma, Junhua Liu, Hui Xue, Xiaoxiang Zuo, Xiangnan He, Chao Shen, Xianglong Liu, Minlie Huang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对开放世界智能体的新兴安全风险,提出一种轻量级可扩展的安全对齐框架,通过更新安全分类法、构建数据引擎并训练小模型(0.8B-8B参数),实现与闭源模型相当的性能,并降低部署开销两个数量级。

Comments 44 pages, 12 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15202 2025-09-19 cs.CR 89%

Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction

Yuanbo Xie, Yingjie Zhang, Tianyun Liu, Duohe Ma, Tingwen Liu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract)

Comments Accepted by EMNLP2025 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20766 2025-08-29 cs.CL cs.AI cs.LG 89%

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection

Harethah Abu Shairah, Hasan Abed Al Kader Hammoud, George Turkiyyah, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09473 2025-08-14 cs.LG cs.AI cs.CL 89%

NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs

Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18025 2025-06-03 cs.LG cs.AI cs.CL cs.CR 89%

An Adversarial Perspective on Machine Unlearning for AI Safety

Jakub Łucki, Boyi Wei, Yangsibo Huang, Peter Henderson, Florian Tramèr, Javier Rando

机构 * ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学)

专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR); Best technical paper at Neurips 2024 SoLaR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12343 2024-06-07 cs.CL cs.AI cs.LG 89%

Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!

Zhanhui Zhou, Jie Liu, Zhichen Dong, Jiaheng Liu, Chao Yang, Wanli Ouyang, Yu Qiao

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09674 2025-05-28 cs.CL cs.AI 89%

The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions

Wenbo Pan, Zhichao Liu, Qiguang Chen, Xiangyang Zhou, Haining Yu, Xiaohua Jia

机构 * Wenbo Pan(温波 Pan) Zhichao Liu(刘志超 Liu) Qiguang Chen(陈启广 Chen) Xiangyang Zhou(周祥阳 Zhou) Haining Yu(于航 Yu) Xiaohua Jia(贾小华 Jia)

专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.CL、cs.AI

Comments Code and artifacts: https://github.com/BMPixel/safety-residual-space Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10513 2026-08-12 cs.CV cs.AI 新提交 89%

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

专题命中 安全训练 :safety(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)

AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。

Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08930 2026-05-12 cs.AI 89%

Internalizing Safety Understanding in Large Reasoning Models via Verification

通过验证内部化安全理解以提升大推理模型

Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,summary_cn);alignment(abstract);分类 cs.AI

AI总结 本文提出Safety Internal框架,通过训练模型在安全验证任务中自我批判生成答案,提升模型对自身输出安全性的判断能力,增强对抗性突破的鲁棒性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22183 2025-06-30 cs.AI 89%

A Different Approach to AI Safety: Proceedings from the Columbia Convening on Openness in Artificial Intelligence and AI Safety

Camille François, Ludovic Péran, Ayah Bdeir, Nouha Dziri, Will Hawkins, Yacine Jernite, Sayash Kapoor, Juliet Shen, Heidy Khlaaf, Kevin Klyman, Nik Marda, Marie Pellat, Deb Raji, Divya Siddarth, Aviya Skowron, Joseph Spisak, Madhulika Srikumar, Victor Storchan, Audrey Tang, Jen Weedon

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

Comments Proceedings from the Columbia Convening on Openness in Artificial Intelligence and AI Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18341 2024-03-28 cs.CL 89%

IterAlign: Iterative Constitutional Alignment of Large Language Models

Xiusi Chen, Hongzhi Wen, Sreyashi Nag, Chen Luo, Qingyu Yin, Ruirui Li, Zheng Li, Wei Wang

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);red teaming(abstract)

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17239 2026-08-11 cs.CL cs.AI 88%

SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging

SafeMERGE: 通过选择性层间模型融合在微调大语言模型中保持安全对齐

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafeMERGE,一种轻量级后微调框架,通过选择性融合层间模型来恢复安全对齐,同时保持下游性能,减少有害输出并提升实用性。

Journal ref Findings of the ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新 88%

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13562 2026-06-30 cs.CR cs.AI cs.CL 88%

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡

Yanbo Wang, Minzheng Wang, Jian Liang, Lu Wang, Yongcan Yu, Ran He

机构 * Ritzz-AI

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19168 2026-06-18 cs.AI cs.LG 新提交 88%

Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection

超越安全数据:具有正则安全反射的预训练阶段对齐

Jinhan Li, Kexian Tang, Yihan Xu, Zhuorui Ye, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07445 2026-06-09 cs.CL cs.LG 版本更新 88%

Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning

少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06519 2026-06-08 cs.AI cs.LG 新提交 88%

SafeGene: Reusable Adapters for Transferable Safety Alignment

SafeGene: 可重用的适配器实现可迁移的安全对齐

Yanghan Wang, Zhiqiang Kou, Fu Feng, Jing Wang, Xin Geng

机构 * Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SafeGene,一种可重用的安全适配器模块,通过从对齐-退化模型差异中提取安全表示,并利用数据感知层选择和少样本系数重校准,实现跨任务的安全恢复,在保持下游性能的同时降低有害响应率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-06-02 cs.AI cs.CL 88%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00369 2026-06-02 cs.CY cs.LG 88%

Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

量化地理文化价值对多元安全对齐的显著性

Arkadiy Saakyan, Charvi Rastogi, Lora Aroyo

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CY、cs.LG

AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。

Comments 119 pages, 13 figures. ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20320 2026-03-24 cs.SE cs.AI cs.LG 88%

The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents

工具可及性对LLM代理安全对齐的因果影响

Shasha Yu, Fiona Carroll, Barry L. Bentley

机构 * Cardiff Metropolitan University(卡地夫 Metropolitan 大学) Harvard Medical School(哈佛医学院) Clark University(克拉克大学) Harvard University(哈佛大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比文本聊天机器人与具备工具访问权限的代理行为,发现工具可及性显著增加安全违规率,表明文本评估不足以评估代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06727 2026-03-10 cs.LG cs.AI 88%

Safe Transformer: An Explicit Safety Bit For Interpretable And Controllable Alignment

安全变换器:一种可解释和可控的对齐显式安全位

Jingyuan Feng, Andrew Gambardella, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 Safe Transformer通过在模型中插入显式安全位,实现安全行为的可解释和可控,通过对比训练解耦表示,提升安全性和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15799 2026-02-18 cs.LG cs.AI 88%

The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety

对齐崩溃的几何学:当微调破坏安全性

Max Springer, Chung Peng Lee, Blossom Metevier, Jane Castleman, Bohdan Turbal, Hayoung Jung, Zeyu Shen, Aleksandra Korolova

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了微调过程中对齐脆弱性是梯度下降在曲面上的固有几何属性,提出四次方定律描述对齐损失随训练时间的增长,并呼吁发展曲率感知方法以提升安全性。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23286 2026-02-04 cs.CL cs.AI 88%

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型

Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 A2D通过令牌级对齐方法,在扩散语言模型中实现任意顺序和步长攻击的鲁棒防御,显著降低有害输出生成概率并提升安全终止效率。

Comments Accepted at ICLR 2026. Code and models are available at https://ai-isl.github.io/A2D

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02027 2026-02-03 cs.AI cs.LG 88%

Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron

通过单个神经元的模型自反进行轻量级对齐以提升大语言模型的安全性

Sicheng Shen, Mingyang Lv, Han Shen, Jialin Wu, Binghao Wang, Zhou Yang, Guobin Shen, Dongcheng Zhao, Feifei Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Ant Group Co., Ltd.(蚂蚁集团有限公司) BrainCog Lab., CASIA(CASIA脑认知实验室) Zhongguancun Academy(中关村学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 通过单个神经元的模型自反实现轻量级对齐,提升大语言模型的安全性和实用性

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03537 2026-01-08 cs.AI cs.CL 88%

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

通过安全规则的自教推理提升安全性

Di Wu, Yanyan Zhao, Xin Lu, Mingzhe Li, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。

Comments 19 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18081 2025-10-22 cs.LG cs.AI 88%

Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth

Jiawei Zhang, Andrew Estornell, David D. Baek, Bo Li, Xiaojun Xu

机构 * University of Chicago(芝加哥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14987 2025-07-22 cs.AI cs.CR cs.LG 88%

AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

Yi Zhang, An Zhang, XiuYu Zhang, Leheng Sheng, Yuxin Chen, Zhenkai Liang, Xiang Wang

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏