arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 20 篇

2606.02530 2026-06-02 cs.AI cs.CL 88%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00369 2026-06-02 cs.CY cs.LG 88%

Quantifying the Salience of Geo-Cultural Values for Pluralistic Safety Alignment

量化地理文化价值对多元安全对齐的显著性

Arkadiy Saakyan, Charvi Rastogi, Lora Aroyo

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CY、cs.LG

AI总结 通过多层次模型分析,发现文化区域归属对安全评分有显著影响(p<0.05),约10%的项目存在文化敏感性,当前LLM无法可靠替代人类评分员但可辅助筛选。

Comments 119 pages, 13 figures. ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00686 2026-06-02 cs.LG 88%

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

对齐的辩证法:利用不安全知识实现动态安全路由

Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24583 2026-06-02 cs.LG cs.CL stat.ML 84%

Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol

正确测量对齐引起的激活偏移:一种模板控制的双重差分协议

Yuki Nakamura

机构 * The Open University of Japan(日本开放大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 针对对齐前后模型内部激活比较中存在的聊天模板混淆问题,提出模板控制的双重差分协议,有效分离对齐偏移与格式效应,恢复拒绝方向并提升余弦对齐度。

Comments 11 pages, 1 figure. v3: substantially revised and reframed as a measurement-methodology paper. Code, data, and an immutable Zenodo archive are available at https://github.com/Nakammura/effective-rank-audit (DOI: 10.5281/zenodo.20341444)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00975 2026-06-02 cs.CL 79%

Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

迷失在妄想中:审视用户妄想与痛苦下的LLM安全性

Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan, Nathan S. Fishbein, Yu-Ru Lin, Maarten Sap

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Fordham University(福特汉姆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04512 2026-06-02 cs.AI 79%

Safety Must Precede the Deployment of Open-Ended AI

安全必须优先于开放式AI的部署

Ivaxi Sheth, Jan Wehner, Sahar Abdelnabi, Ruta Binkyte, Mario Fritz

机构 * CISPA-Helmholtz Center of Information Security(CISPA-海德堡信息安全中心) MPI for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(智能系统Max Planck研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出开放式AI系统因自主无限生成新行为而带来预测性丧失、新兴错位和控制困难等独特安全挑战,需在部署前主动研究,并给出挑战分类和研究方向。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07177 2026-06-02 cs.CR cs.AI 74%

Safe-FedLLM: Delving into the Safety of Federated Large Language Models

Safe-FedLLM:深入探究联邦大语言模型的安全性

Mingxiang Tao, Yu Tian, Wenxuan Tu, Yue Yang, Xue Yang, Xiangyan Tang

机构 * Hainan University(海南大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 本文提出Safe-FedLLM,一种基于探针的防御框架,通过三级防御(步骤级、客户端级和阴影级)利用轻量级分类器区分恶意与良性LoRA更新,以增强联邦大语言模型对恶意客户端的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17952 2026-06-02 cs.CL cs.AI 73%

A Monosemantic Attribution Framework for Stable Interpretability in Clinical Neuroscience Transformer-Based Language Models

面向临床神经科学中基于Transformer的语言模型的稳定可解释性的单语义归因框架

Michail Mamalakis, Tiago Azevedo, Cristian Cosentino, Chiara D'Ercoli, Subati Abulikemu, Zhongtian Sun, Richard Bethlehem, Pietro Lio

机构 * Department of Computer Science and Technology(计算机科学与技术系) Cancer Research UK(癌症研究英国公司) Cambridge Institute(剑桥研究所) University of Cambridge(剑桥大学) United Kingdom(英国) DIMES(迪梅斯) University of Calabria(卡拉布里亚大学) Italy(意大利) Department of Computer Automatic and Management Engineering (DIAG)(计算机自动与管理工程系) Sapienza Università di Roma(罗马大学萨皮恩扎) Department of Psychiatry(精神病学系) School of Computing(计算学院) University of Kent(肯特大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出一种通过单语义特征提取整合归因与机制视角的统一可解释性框架,生成稳定的输入级重要性分数,促进语言模型在认知健康和神经退行性疾病中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12487 2026-06-02 cs.NE cs.AI cs.CL 73%

ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models

ToxSearch: 面向大型语言模型毒性搜索的提示演化

Onkar Shelar, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术研究所)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出ToxSearch,一种黑盒演化框架,通过同步稳态循环演化提示来测试大型语言模型的安全性,并分析不同操作符的行为及跨模型迁移性。

Comments 16 pages

Journal ref In: García-Sánchez, P., Díaz Álvarez, J., Murphy, A. (eds) Applications of Evolutionary Computation. EvoApplications 2026. Lecture Notes in Computer Science, vol 16525. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00400 2026-06-02 cs.LG 70%

Dynamic Proxy-Mixing: Transferring Replay Controllers from Small to Large Models for Continual Instruction Tuning

动态代理混合:将重放控制器从小模型迁移到大模型以进行持续指令微调

Ibne Farabi Shihab, Fariya Afrin, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建筑与环境工程系)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 提出PROXY-MIX框架,通过在小代理模型上学习动态重放控制器并冻结迁移至大模型,以解决持续指令微调中固定重放比例导致的灾难性遗忘问题,在LLaMA-3-8B上平均准确率提升3.4%,遗忘降低3.5%,安全性提升5.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10688 2026-06-02 cs.LG cs.AI cs.CL 67%

SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting

SCOPE: 信号校准的在线策略蒸馏增强与双路径自适应加权

Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu, Kepeng Lin, Benchang Zhu, Ke Zeng, Xunliang Cai

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Interaction Team(美团 LongCat 交互团队) Nanjing University(南京大学) Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对在线策略强化学习中奖励稀疏导致的信用分配难题,提出SCOPE框架,通过双路径自适应加权机制分别处理正确与错误轨迹,实现信号校准的蒸馏增强,在六个推理基准上平均提升11.42%的Avg@32和7.30%的Pass@32。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16174 2026-06-02 cs.LG cs.AI cs.CL cs.CR 67%

Efficient LLM Moderation with Multi-Layer Latent Prototypes

基于多层潜在原型的高效LLM审核

Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

机构 * University of Warsaw(华沙大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多层原型审核器(MLPM),利用多层中间表示的原型实现轻量、高效且可定制的输入审核,在多个基准上达到最优性能,并可与输出审核结合提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24324 2026-06-02 cs.LG cs.AI cs.SY eess.SY 62%

Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learning

大语言模型引导的激励感知奖励设计用于合作多智能体强化学习

Dogan Urgun, Gokhan Gungor

机构 * Department of Electrical and Electronics Engineering(电气与电子工程系) Karabuk University(卡拉博克大学) Department of Mechatronics Engineering(机械工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出利用大语言模型自动生成可执行奖励程序,结合多智能体近端策略优化训练,在Overcooked-AI环境中显著提升合作任务回报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01779 2026-06-02 cs.CL 57%

HarnessForge: Joint Harness and Policy Evolution for Adaptive Agent Systems

HarnessForge:面向自适应智能体系统的协同框架与策略进化

Mingju Chen, Can Lv, Guibin Zhang, Heng Chang, Shiji Zhou

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出HarnessForge元自适应框架,通过框架-策略协同进化实现LLM智能体系统的全系统自适应,在多个基准上显著提升性能。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03403 2026-06-02 cs.CV cs.LG 57%

GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning

GRPO-TTA:基于GRPO驱动的强化学习进行视觉语言模型的测试时视觉调优

Yujun Li, Hongyuan Zhang, Yuan Yuan

机构 * School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(人工智能、光学与电子学院(iOPEN),西北工业大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出GRPO-TTA方法,将GRPO应用于测试时适应,通过将类特定提示预测重构为组策略优化问题,并设计对齐奖励和分散奖励,在多种基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00873 2026-06-02 cs.CY 57%

Prompts for Public-Sector LLMs Should Be Governed as Commons

公共部门LLM的提示应作为公共资源进行治理

Rashid Mushkani

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文提出公共部门部署大型语言模型时使用的提示应作为受治理的制品,而非私有临时输入,并设计了带版本控制、社区维护的提示模板仓库及协商集成方法。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-06-02 cs.AI 57%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00090 2026-06-02 cs.RO cs.AI 57%

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

物理AI中的静默故障:自主系统运行时动作授权的文献综述

Barak Or

机构 * STATE16

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文综述了物理AI系统中黑箱模型发出看似合理但实际错误的物理动作导致的静默故障问题,提出了运行时防护栏的分类和评估要求。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18373 2026-06-02 cs.CV cs.AI 57%

To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs

看见还是取悦:揭示视觉语言模型中的视觉谄媚与分裂信念

Rui Hong, Shuxue Quan

机构 * George Mason University(乔治·玛斯纳大学) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出三层诊断框架,通过反事实干预实验发现视觉语言模型中普遍存在视觉谄媚(内部证据保留但输出幻觉答案)现象,并证明扩展模型规模无法解决该问题。

Comments 14 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01663 2026-06-02 cs.GT cs.DC cs.MA 50%

A Sheaf Framework for Strategic Multi-Agent Systems: From Consensus to Nash Equilibria

面向策略性多智能体系统的层框架:从共识到纳什均衡

Manuel Hernández, Eduardo Sánchez-Soto

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出一个统一的范畴框架,通过引入博弈层概念,将事件演算、SCEL类集成形成和博弈论奖励结构整合到时空历史的格罗滕迪克拓扑中,并证明纳什均衡对应于派生最佳响应对应层的全局截面,而同调障碍分类策略一致性的失败。

详情

展开后加载摘要…

URL PDF HTML 收藏