arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2603.06816 2026-03-10 cs.CL cs.AI q-bio.NC 73%

"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior

黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为

Roshni Lulla, Fiona Collins, Sanaya Parekh, Thilo Hagendorff, Jonas Kaplan

机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) Department of Psychology, University of Southern California(心理学系,南加州大学) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。

Comments 38 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04355 2026-03-05 cs.LG cs.AI 73%

Efficient Refusal Ablation in LLM through Optimal Transport

通过最优传输实现LLM中的高效拒绝消融

Geraldin Nanfack, Eugene Belilovsky, Elvis Dohmatob

机构 * Concordia University(康科德大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于最优传输的框架,通过层选择性干预提升LLM拒绝机制的鲁棒性,实现更高的攻击成功率并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03323 2026-03-05 cs.CL cs.AI 73%

Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement

辨别真伪:通过对比细化减少过度拒绝

Yuxiao Lu, Lin Xu, Yang Sun, Wenjun Li, Jie Shi

机构 * Huawei Technologies co. ltd(华为技术有限公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCR方法,通过对比细化减少LLM的过度拒绝问题,同时保持安全性和通用能力。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16602 2026-02-25 cs.CL cs.AI 73%

Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics

拒绝引导:为敏感话题对LLM拒绝行为实现细粒度控制

Iker García-Ferrero, David Montero, Roman Orus

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 通过引导向量控制LLM在敏感话题上的拒绝行为,实现安全且可控的审核方法。

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08796 2026-02-17 cs.LG cs.AI 73%

Robust Multi-Objective Controlled Decoding of Large Language Models

鲁棒多目标控制解码大型语言模型

Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University College London(伦敦大学学院) Ulsan National Institute of Science and Technology(釜山国立科学技术研究所) University of Basel(巴塞尔大学) University College London AI Centre(伦敦大学学院人工智能中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RMOD算法,通过最大化最坏情况奖励实现鲁棒多目标解码,有效提升大型语言模型在多个人类目标上的对齐性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11729 2026-02-13 cs.AI cs.LG cs.SE 73%

Cross-Architecture Model Diffing with Crosscoders: Unsupervised Discovery of Differences Between LLMs

跨架构模型差异分析与Crosscoders:无监督发现不同LLM之间的差异

Thomas Jiralerspong, Trenton Bricken

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Dedicated Feature Crosscoders,通过无监督方法发现不同LLM之间的行为差异,如中国共产党一致性、美国例外论和版权拒绝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09660 2026-02-13 cs.CL cs.LG 73%

Steering MoE LLMs via Expert (De)Activation

通过专家(去)激活引导MoE LLMs

Mohsen Fayyaz, Ali Modarressi, Hanieh Deilamsalehy, Franck Dernoncourt, Ryan Rossi, Trung Bui, Hinrich Schütze, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Adobe Research(Adobe研究) CIS, LMU Munich(慕尼黑大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07022 2026-02-10 cs.LG cs.AI cs.CR 73%

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

AlphaSteer: 通过原理性零空间约束学习拒绝引导

Leheng Sheng, Changshuo Shen, Weixiang Zhao, Junfeng Fang, Xiaohao Liu, Zhenkai Liang, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 AlphaSteer 通过原理性零空间约束学习拒绝引导,提升大语言模型的安全性与效用平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 73%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06258 2026-02-09 cs.LG cs.AI 73%

GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt

GRP-Obliteration: 通过单个无标签提示解耦大语言模型

Mark Russinovich, Yanan Cai, Keegan Hines, Giorgio Severi, Blake Bullwinkel, Ahmed Salem

机构 * Microsoft(微软)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 GRP-Obliteration通过单个无标签提示解耦大语言模型,利用GRPO技术有效移除安全约束,实现更强的不对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04426 2026-01-26 cs.LG cs.AI 73%

Towards Fast Safe Online Reinforcement Learning via Policy Finetuning

通过策略微调实现快速安全在线强化学习

Keru Chen, Honghao Wei, Zhigang Deng, Sen Lin

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) Washington State University(华盛顿州立大学) Department of Computer Science(计算机科学系) University of Houston(休斯顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Marvel框架,通过价值预对齐和自适应PID控制,实现更高效安全的在线强化学习。

Comments Accepted by Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 73%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00454 2026-01-05 cs.CL cs.AI 73%

Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations

防御性M2S:在压缩的多轮对话上训练防护模型

Hyunjun Kim

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 Defensive M2S通过压缩多轮对话训练防护模型,显著降低训练和推理成本,提升攻击检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23717 2026-01-01 cs.CL cs.AI 73%

HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate

HarmTransform: 通过多智能体辩论将显性有害查询转化为隐蔽形式

Shenzhe Zhu

机构 * University of Toronto(多伦多大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 HarmTransform通过多智能体辩论框架,系统地将有害查询转化为隐蔽形式,以提升大型语言模型的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07462 2025-12-15 cs.MA cs.AI cs.GT cs.LG math.DS 73%

Understanding LLM Agent Behaviours via Game Theory: Strategy Recognition, Biases and Multi-Agent Dynamics

通过博弈论理解LLM代理行为:策略识别、偏差与多代理动态

Trung-Kiet Huynh, Duy-Minh Dao-Sy, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information and Technology, Ho Chi Minh City University of Science (HCMUS), Vietnam(信息科技学院,胡志明市科学大学(HCMUS)) Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南国家大学-胡志明市(VNU-HCM)) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT))

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过扩展FAIRGAME框架,系统评估LLM在重复社会困境中的行为,揭示其策略识别、偏差及多代理动态,为AI治理和安全多代理系统设计提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14428 2025-11-19 cs.LO cs.AI cs.CY 73%

Context-aware, Ante-hoc Explanations of Driving Behaviour

Dominik Grundt, Ishan Saxena, Malte Petersen, Bernd Westphal, Eike Möhlmann

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

Comments In Proceedings FMAS 2025, arXiv:2511.13245

Journal ref EPTCS 436, 2025, pp. 114-135

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11693 2025-11-18 cs.AI cs.CR cs.CV cs.LG 73%

Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation

Xin Zhao, Xiaojun Chen, Bingshan Liu, Zeyao Liu, Zhendong Zhao, Xiaoyan Gu

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18053 2025-10-22 cs.LG cs.AI 73%

Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models

Jiajun Fan, Tong Wei, Chaoran Cheng, Yuxin Chen, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05179 2025-10-17 cs.CR cs.AI cs.LG 73%

Agentic Misalignment: How LLMs Could Be Insider Threats

Aengus Lynch, Benjamin Wright, Caleb Larson, Stuart J. Ritchie, Soren Mindermann, Evan Hubinger, Ethan Perez, Kevin Troy

机构 * University College London(伦敦大学学院) Anthropic MATS Mila

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 12 figures. Code available at https://github.com/anthropic-experimental/agentic-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02781 2025-09-26 q-bio.QM cs.AI cs.LG 73%

Multimodal AI predicts clinical outcomes of drug combinations from preclinical data

Yepeng Huang, Xiaorui Su, Varun Ullanat, Intae Moon, Ivy Liang, Lindsay Clegg, Damilola Olabode, Ruthie Johnson, Nicholas Ho, Megan Gibbs, Megan Gibbs, Alexander Gusev, Bino John, Marinka Zitnik

机构 * Harvard Medical School(哈佛医学院) Harvard College(哈佛学院) AstraZeneca(阿斯利康) Carnegie Mellon University(卡内基梅隆大学) Dana-Farber Cancer Institute and Harvard Medical School(达纳-法伯癌症研究所和哈佛医学院) Harvard University(哈佛大学) Broad Institute of MIT and Harvard(MIT和哈佛大学 Broad研究所) Harvard Data Science Initiative(哈佛数据科学计划)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18556 2025-08-26 cs.CL cs.AI 73%

Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation

Jun Zhuang, Haibo Jin, Ye Zhang, Zhengjian Kang, Wenbin Zhang, Gaby G. Dagher, Haohan Wang

机构 * Boise State University(博伊州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pittsburgh(匹兹堡大学) New York University(纽约大学) Florida International University(佛罗里达国际大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted for EMNLP'25 Findings. TL;DR: We propose a new two-stage intent-based prompt-refinement framework, IntentPrompt, that aims to explore the vulnerability of LLMs' content moderation guardrails by refining prompts into benign-looking declarative forms via intent manipulation for red-teaming purposes

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13774 2025-08-12 cs.AI cs.CY cs.MA 73%

Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values

Nell Watson, Ahmed Amer, Evan Harris, Preeti Ravindra, Shujun Zhang

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

Comments 42 pages, 6 figures

Journal ref Information 2025, 16(8), 651

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04250 2025-07-08 cs.LG cs.AI 73%

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning

Mahavir Dabas, Si Chen, Charles Fleming, Ming Jin, Ruoxi Jia

机构 * Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院与州立大学电气与计算机工程系) Cisco Research, San Jose, CA, USA(思科研究)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20947 2025-06-17 cs.CL cs.AI 73%

OR-Bench: An Over-Refusal Benchmark for Large Language Models

Justin Cui, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025, we thank everyone for their valuable suggestions and feedback!

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05422 2025-06-09 cs.AI cs.LG 73%

Constructive Symbolic Reinforcement Learning via Intuitionistic Logic and Goal-Chaining Inference

Andrei T. Patrascu

机构 * FAST Foundation(FAST基金会)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11838 2025-05-30 cs.CL cs.AI 73%

Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models

Yi Luo, Zhenghao Lin, Yuhao Zhang, Jiashuo Sun, Chen Lin, Chengjin Xu, Xiangdong Su, Yelong Shen, Jian Guo, Yeyun Gong

机构 * XiaMen University(厦门大学) Yanshan University(雁山大学) IDEA Research(IDEA研究) Inner Mongolia University(内蒙古大学) Microsoft(微软) Microsoft Research Asia(微软亚洲研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2024 main conference

Journal ref Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22271 2025-05-29 cs.CR cs.AI cs.CL 73%

Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models

Yongcan Yu, Yanbo Wang, Ran He, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(国家工程实验室与人工智能研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12946 2025-04-10 cs.CL cs.LG 73%

A Flexible Large Language Models Guardrail Development Methodology Applied to Off-Topic Prompt Detection

Gabriel Chua, Shing Yee Chan, Shaun Khoo

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04741 2025-03-10 cs.CY cs.AI 73%

Which Information should the UK and US AISI share with an International Network of AISIs? Opportunities, Risks, and a Tentative Proposal

Lara Thurnherr

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 12 Pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10414 2025-02-25 cs.CR cs.CL cs.LG 73%

On Calibration of LLM-based Guard Models for Reliable Content Moderation

Hongfu Liu, Hengguan Huang, Xiangming Gu, Hao Wang, Ye Wang

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏