arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2103.03938 2021-03-09 cs.AI cs.LG 85%

Causal Analysis of Agent Behavior for AI Safety

Grégoire Déletang, Jordi Grau-Moya, Miljan Martic, Tim Genewein, Tom McGrath, Vladimir Mikulik, Markus Kunesch, Shane Legg, Pedro A. Ortega

专题命中 安全训练 :safety(title);AI safety(title);分类 cs.AI、cs.LG

Comments 16 pages, 16 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00062 2026-08-11 cs.CY cs.CL cs.CR cs.LG 85%

SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models

SafeCOMM: 对于在电信领域微调的大型语言模型安全退化的研究

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Fernando Koch, Walid Saad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院) Florida Atlantic University(佛罗里达 Atlantic 大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 本文研究了在电信领域微调的大型语言模型的安全退化问题,提出TeleHarm基准测试及三种防御方法,展示了如何通过安全重对齐提升模型安全性,实现SafeCOMM模型。

Journal ref IEEE Wireless Communications and Networking Conference (WCNC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01913 2026-08-07 cs.LG cs.AI cs.CE cs.CL cs.CR 85%

RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

RefusalGuard:面向大语言模型安全的保几何微调方法

Sadia Asif, Mohammad Mohammadi Amiri

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。

Journal ref Conference of Languge Modeling, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27081 2026-07-30 cs.AI cs.CL cs.CR cs.LG 新提交 85%

On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment

面向大语言模型安全的在线策略蒸馏:一种针对模板鲁棒性的重对齐路由方法

Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

机构 * Tsinghua University(清华大学) Swinburne University of Technology(斯威本科技大学) EPFL(洛桑联邦理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有LLM安全防御的模板鲁棒性不足等问题,提出ROPD框架,通过建模输出分布差异实现重对齐,大幅降低模板不匹配风险,在防御有效性和能力保留上优于基线方法,建立了新的鲁棒重对齐标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15977 2026-07-20 cs.CR 新提交 85%

Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization

拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险

Yu Cui, Ruiqing Yue, Tingyu Li, Sicheng Pan, Zhuoyu Sun, Xufeng Zhang, Baohan Huang, Haibin Zhang, Cong Zuo

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25013 2026-06-25 cs.LG cs.AI cs.CL 新提交 85%

Do Thinking Tokens Help with Safety?

思考令牌有助于安全性吗?

Narutatsu Ri, Abhishek Panigrahi, Sanjeev Arora

机构 * Princeton Language and Intelligence(普林斯顿语言与智能)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12342 2026-06-11 cs.CL cs.AI cs.ET cs.LG 新提交 85%

ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

ALIGNBEAM: 通过跨词汇表logit混合实现推理时对齐迁移

Chirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对领域微调降低大模型安全性的问题,提出无需训练的ALIGNBEAM方法,通过逐token翻译锚模型logit并选择最安全候选,实现跨词汇表的安全对齐迁移,保持任务准确性和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29659 2026-05-29 cs.LG cs.AI cs.CL 85%

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content

Opir:针对毒性、越狱、仇恨言论和有害内容的高效多任务安全分类

Ihor Stepanov, Aleksandr Smechov

机构 * Knowledgator Wordcab

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于GLiClass架构的Opir系列编码器护栏模型,通过多任务学习实现二进制安全/不安全分类、多标签毒性分类、越狱分类和零样本不安全提示与响应分类,在12项安全分类任务和17项类别任务上与现有护栏系统竞争,同时部署开销更小。

Comments 23 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18491 2026-04-24 cs.AI cs.CC cs.CL cs.CV cs.LG 85%

AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

AgentDoG:一种面向AI代理安全与安全的诊断防护框架

Dongrui Liu, Qihan Ren, Chen Qian, Shuai Shao, Yuejin Xie, Yu Li, Zhonghao Yang, Haoyu Luo, Peng Wang, Qingyu Liu, Binxin Hu, Ling Tang, Jilin Mei, Dadi Guo, Leitao Yuan, Junyao Yang, Guanxu Chen, Qihao Lin, Yi Yu, Bo Zhang, Jiaxuan Guo, Jie Zhang, Wenqi Shao, Huiqi Deng, Zhiheng Xi, Wenjie Wang, Wenxuan Wang, Wen Shen, Zhikai Chen, Haoyu Xie, Jialing Tao, Juntao Dai, Jiaming Ji, Zhongjie Ba, Linfeng Zhang, Yong Liu, Quanshi Zhang, Lei Zhu, Zhihua Wei, Hui Xue, Chaochao Lu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14185 2026-02-10 cs.LG cs.AI cs.CL 85%

Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study

安全子空间并非线性区分:一项微调案例研究

Kaustubh Ponkshe, Shaan Shah, Raghav Singhal, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) University of California San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过微调案例发现,安全行为与通用学习组件高度交织,基于子空间的防御策略存在根本限制。

Comments ICLR 2026. Kaustubh Ponkshe, Shaan Shah, and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01539 2026-02-09 cs.AI cs.CL cs.LG cs.MA 85%

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

MAGIC: 一种共进化攻击者-防御者对抗游戏用于鲁棒大语言模型安全

Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAGIC通过共进化对抗游戏提升大语言模型的安全性,攻击者与防御者智能体在多轮强化学习中相互演化,有效识别并抵御未知攻击模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07482 2025-11-12 cs.LG cs.AI cs.CL 85%

Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits

Dev Patel, Gabrielle Gervacio, Diekola Raimi, Kevin Zhu, Ryan Lagasse, Gabriel Grand, Ashwinee Panda, Maheep Chaudhary

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12428 2025-10-08 cs.CL cs.AI cs.LG 85%

Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models

Yik Siu Chan, Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16457 2025-09-23 cs.CL cs.AI cs.CY 85%

Implicit Behavioral Alignment of Language Agents in High-Stakes Crowd Simulations

Yunzhe Wang, Gale M. Lucas, Burcin Becerik-Gerber, Volkan Ustun

机构 * University of Southern California(南加州大学) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 安全训练 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10304 2025-06-26 cs.AI cs.CC cs.CY cs.LG 85%

The Alignment Trap: Complexity Barriers

Jasper Yao

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 31 Pages, 4 Figures. Substantial revision. Restructured around the Enumeration Paradox and Five Pillars of Impossibility. Core mathematical results unchanged but significantly expanded. Added new impossibility proofs from statistical, information-theoretic, and dynamic perspectives

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08301 2025-06-24 cs.CL cs.AI cs.CY 85%

Compromising Honesty and Harmlessness in Language Models via Deception Attacks

Laurène Vaugrante, Francesca Carlon, Maluna Menke, Thilo Hagendorff

专题命中 安全训练 :harmlessness(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17388 2025-03-25 cs.CY cs.AI cs.LG 85%

AI Companies Should Report Pre- and Post-Mitigation Safety Evaluations

Dillon Bowen, Ann-Kathrin Dombrowski, Adam Gleave, Chris Cundy

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18968 2025-01-31 cs.CY cs.AI cs.LG 85%

Safety challenges of AI in medicine in the era of large language models

Xiaoye Wang, Nicole Xi Zhang, Hongyu He, Trang Nguyen, Kun-Hsing Yu, Hao Deng, Cynthia Brandt, Danielle S. Bitterman, Ling Pan, Ching-Yu Cheng, James Zou, Dianbo Liu

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07471 2024-10-14 cs.LG cs.AI cs.CL 85%

SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection

Han Shen, Pin-Yu Chen, Payel Das, Tianyi Chen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05993 2024-09-12 cs.LG cs.CL cs.CY 85%

AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts

Shaona Ghosh, Prasoon Varshney, Erick Galinkin, Christopher Parisien

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01099 2024-08-21 cs.LG cs.AI cs.CL cs.CR 85%

What is in Your Safe Data? Identifying Benign Data that Breaks Safety

Luxi He, Mengzhou Xia, Peter Henderson

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12321 2024-05-20 cs.CR cs.AI cs.CL cs.LG 85%

Bypassing the Safety Training of Open-Source LLMs with Priming Attacks

Jason Vega, Isha Chaudhary, Changming Xu, Gagandeep Singh

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR Tiny Paper camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02231 2023-11-06 cs.CL cs.AI cs.LG cs.SY eess.SY 85%

Fine-Tuning Language Models with Advantage-Induced Policy Alignment

Banghua Zhu, Hiteshi Sharma, Felipe Vieira Frujeri, Shi Dong, Chenguang Zhu, Michael I. Jordan, Jiantao Jiao

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22686 2026-07-01 cs.CR cs.AI cs.LG 新提交 84%

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

拒绝的几何:安全对齐大语言模型中的线性不稳定性

Shivam Ratnakar, Kartikeya Vats

机构 * University of Southern California(南加州大学) Independent Researcher(独立研究员)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 研究通过对比安全与不安全系统提示的隐藏状态,提出对比逻辑操控(CLS)框架,揭示安全对齐的线性脆弱性,并证明逻辑级干预比隐藏状态方法更有效,同时可实现双向控制。

Comments Accepted at TrustNLP 2026 (Sixth Workshop on Trustworthy Natural Language Processing, ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19024 2026-04-22 cs.LG 84%

Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

基于人类反馈的安全强化学习策略梯度对偶方法

Qiang Liu, Adrienne Kline, Ermin Wei

专题命中 安全训练 :RLHF(summary_cn,abstract);harmlessness(abstract);分类 cs.LG

AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09864 2026-08-11 cs.LG cs.AI cs.ET 版本更新 84%

Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

KV缓存量化下的对齐崩溃:诊断与缓解

Bruce Changlong Xu, Adarsh Kumarappan, Mu Zhou

机构 * Stanford University(斯坦福大学) California Institute of Technology(加利福尼亚理工学院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。

Comments Preprint. 61 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16242 2026-07-21 cs.LG cs.AI cs.CR 新提交 84%

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment

TRACE:基于轨迹的安全补丁学习用于大语言模型训练后调整

Changyue Li, Jiaming He, Youliang Yuan, Jialin Wu, Boxi Yu, Zhicong Huang, Pinjia He

机构 * LERo

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对FTaaS平台削弱模型安全对齐的问题,提出TRACE框架,通过模拟有害轨迹生成损坏状态,优化插件补丁,在保持效用的同时恢复模型安全,在多基准测试和模型上占据安全 - 效用前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11475 2026-07-14 cs.LG cs.CL 新提交 84%

HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models

HyperSafe:微调语言模型推理时的安全恢复

Aznaur Aliev, Carlos Hinojosa, Abdelrahman Eldesokey, Bang An, Bernard Ghanem, Yibo Yang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究针对微调语言模型推理时安全对齐脆弱的问题,提出HyperSafe框架,通过生成特定模型的安全侧网络,利用层激活指纹和超网络映射参数,实现提示级安全分类,有效降低有害响应率,保持任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10455 2026-07-14 cs.AI cs.CL 新提交 84%

ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm

ANCHOR:针对现实世界危害的CLI代理自动对齐审计

Kefan Song, Yanjun Qi

机构 * Anthropic(Anthropic公司)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。

Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新 84%

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏