arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 19 篇

2605.15239 2026-05-19 cs.LG 89%

Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

通过在线策略自我蒸馏减少大语言模型安全对齐的安全部署税

Yu Fu, Longxuan Yu, Haz Sameen Shahgir, Zhipeng Wei, Hui Liu, N. Benjamin Erichson, Yue Dong

机构 * International Computer Science Institute(国际计算机科学研究所) Microsoft(微软) Berkeley Lab(伯克利实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出了一种名为OPSA的在线策略自我蒸馏方法,通过引入教师翻转率指标,有效减少大语言模型在安全对齐过程中因分布不匹配导致的安全税,实验显示其在不同模型规模上均优于传统方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17413 2026-05-19 cs.CR cs.AI 89%

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

消除安全性:用于安全应用的语言模型对齐机制

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.AI

AI总结 该研究探讨了通过受控转换评估协议去除语言模型对齐机制的方法,评估了安全任务中的拒绝率、尝试率、安全成功率、一般能力保留、不稳定性及超出范围的不安全合规性,证明了去除对齐作为效用-风险前沿的重要性,而非单纯的去审查配方。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22510 2026-05-19 cs.CL 86%

We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong

我们思考,因此我们对LLMs进行对齐,使其在出错前变得有益、无害和诚实

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing Macquarie University(计算机学院麦Quarie大学)

专题命中 安全训练 :RLHF(abstract,abstract_cn);harmlessness(abstract,abstract_cn);alignment(abstract);trustworthy(abstract)

AI总结 本文提出AMBS框架,通过在1-to-N Transformer设置中参数化目标特定转换,解决LLM对齐中多个目标之间的干扰问题,提升HHH目标的联合满足能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16691 2026-05-19 cs.CL cs.DC cs.MA 84%

Responsible Federated LLMs via Safety Filtering and Constitutional AI

通过安全过滤和宪法AI实现负责任的联邦大语言模型

Eunchung Noh, Jeonghun Baek

机构 * Samsung Electronics(三星电子) The University of Tokyo(东京大学)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract,comments);分类 cs.CL

AI总结 本文提出在联邦大语言模型中引入安全过滤和宪法AI技术,以提升模型安全性,实验显示在AdvBench上安全性能提升超过20%。

Comments Accepted at the 6th Workshop on Trustworthy NLP (TrustNLP), ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20218 2026-05-19 cs.LG 83%

Fine-grained List-wise Alignment for Generative Medication Recommendation

细粒度列表级对齐用于生成性药物推荐

Chenxiao Fan, Chongming Gao, Wentao Shi, Yaxin Gong, Zihao Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文提出FLAME框架,通过细粒度列表级对齐方法,利用大语言模型生成药物列表,以提高药物推荐的准确性和安全性,同时考虑药物间的相互作用和潜在不良反应。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18104 2026-05-19 cs.AI cs.CR 83%

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction

多模态大语言模型中的安全几何坍缩与自适应漂移修正

Jiahe Guo, Xiangran Guo, Jiaxuan Chen, Weixiang Zhao, Yanyan Zhao, Yutai Hou, Qianchao Wang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在跨模态安全转移中的不足,提出安全几何坍缩现象,并通过自适应漂移修正方法提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16938 2026-05-19 cs.CL cs.AI q-bio.NC 81%

Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models

努力作为上限,而非调节器:推理预算不影响人类与大推理模型之间的认知成本对齐

Yueqing Hu, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨了推理预算是否影响人类与大推理模型之间的认知成本对齐,发现无论推理努力如何变化,对齐情况保持不变,表明这种对齐是在训练时形成的,而非在推理时动态调整。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16894 2026-05-19 cs.RO cs.SY eess.SY 71%

Beyond Safety Filtering: Control Barrier Function-Informed Reinforcement Learning for Connected and Automated Vehicles

超越安全过滤:基于控制屏障函数的强化学习用于连接和自动化车辆

Jianye Xu, Bassam Alrifaee

机构 * Department of Computer Science, RWTH Aachen University, Germany(德国亚琛工业大学计算机科学系)

专题命中 安全训练 :safety(title)

AI总结 本文提出了一种基于控制屏障函数的多智能体强化学习奖励设计方法,通过将联合多智能体强化学习动作下的控制屏障函数约束值转化为奖励信号,以显式引导安全学习,并在四向多车道交叉口实验中验证了其在任务性能和对奖励超参数的鲁棒性方面优于传统启发式方法。

Comments This paper has been accepted for publication in the Proceedings of the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16776 2026-05-19 cs.LG cs.AI 62%

Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning

可区分删除:统一知识擦除与拒绝用于大语言模型去学习

Puning Yang, Junchi Yu, Qizhou Wang, Philip Torr, Bo Han, Xiuying Chen

机构 * Department of Natural Language Processing, MBZUAI. University of Oxford. RIKEN Center for Advanced Intelligence Project. TMLR Group, Department of Computer Science, Hong Kong Baptist University

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出D^2方法,通过限制潜在表示中的响应分布来擦除不受欢迎的知识,同时区分保留知识,从而实现安全且一致的拒绝机制,以提高大语言模型去学习的效果。

Comments ICML2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16746 2026-05-19 cs.AI cs.LG 62%

State Contamination in Memory-Augmented LLM Agents

内存增强型大语言模型代理中的状态污染

Yian Wang, Agam Goyal, Yuen Chen, Hari Sundaram

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了内存增强型大语言模型代理中由于状态污染导致的安全问题,通过分析内存总结中的毒性内容传播,提出了一种新的衡量指标,并指出在信息压缩前进行净化可以有效减少潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18672 2026-05-19 cs.AI 57%

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的

S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

机构 * CSX-AI University of Liverpool(利物浦大学) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Austrian Institute of Technology(奥地利技术研究院) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18529 2026-05-19 cs.AI 57%

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD:不对称元反射自蒸馏用于标记级信用分配

Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin

机构 * Meituan Beijing, China(美团北京,中国) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出AMR-SD,一种不对称元反射自蒸馏方法,旨在解决大型语言模型在复杂推理中因统一序列奖励导致的信用分配瓶颈问题,通过引入反思瓶颈和因果信息增益机制,实现更精确的标记级优势调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-05-19 cs.CV cs.CL 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15377 2026-05-19 cs.AI 57%

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

为AI控制的集束监控:多样信号胜过更多计算

Eugene Koran, Yejun Yun, Samantha Tetef, Benjamin Arnav, Pablo Bernabeu-Pérez

机构 * Yale University(耶鲁大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03879 2026-05-19 cs.SE cs.AI 57%

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

对抗性代理协作提升C到安全Rust翻译的正确性

Tianyu Li, Ruishi Li, Bo Wang, Brandon Paulsen, Umang Mathur, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出ACToR框架,通过对抗性搜索发现翻译与C源码分歧的输入,利用这些输入驱动后续优化,提升C到Rust翻译的正确性,实验表明其在多个真实世界工具中达到90%以上的测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17329 2026-05-19 cs.CR cs.AI 57%

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails

LPG: 在潜在策略护栏中平衡效率与政策推理

Nanxi Li, Zhengyue Zhao, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17204 2026-05-19 cs.RO cs.AI 57%

Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies

基于事件的稀疏自编码器用于视觉-语言-动作策略

Xinchen Jin, Aditya Chatterjee, Pranav Kumar, Rohan Paleja

机构 * Department of Computer Science, Purdue University West Lafayette, IN 47907(计算机科学系,普渡大学西拉法叶分校,印第安纳州,47907)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于事件的稀疏自编码器(SAE)分析方法,用于视觉-语言-动作(VLA)策略的可解释性研究,通过行为事件锚定SAE特征分析,提升了对闭合回路行为的因果影响和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16735 2026-05-19 cs.NI cs.LG 57%

Transformer-Based MCS Prediction for 5G Multicast-Broadcast Services (MBS)

基于Transformer的5G多播广播服务(MBS)的MCS预测

Kasidis Arunruangsirilert, Jiro Katto

机构 * Department of Computer Science and Communications Engineering(计算机科学与通信工程系) Waseda University(早稻田大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种轻量级的基于Transformer的框架,用于预测即将到来的视频片段 horizon 上所有28个MCS指数的成功概率,以提高5G多播广播服务的可靠性。

Comments 2026 IEEE 104th Vehicular Technology Conference (VTC2026-Fall), 6-9 September 2026, Boston, Massachusetts, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02512 2026-05-19 cs.ET cs.AI cs.SE 57%

Human-Certified Module Repositories for the AI Age

面向AI时代的可信模块仓库

Szilárd Enyedi

机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。

Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏