arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2605.21834 2026-05-22 cs.LG 85%

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21683 2026-05-22 cs.AI 83%

Investigating Concept Alignment Using Implausible Category Members

通过不合理的类别成员探究概念对齐

Sunayana Rane, Brenden M. Lake, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(title);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文研究了通过询问不合理类别成员来探究概念边界,发现AI模型在某些概念上与人类存在显著差异,如将'词语'归类为'车辆'或'衣物',并探讨了这些概念错位对AI安全的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21609 2026-05-22 cs.CL cs.AI cs.CY 82%

CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety

CR4T:基于重写的青少年LLM安全机制

Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CR4T框架,通过选择性响应重构替代拒绝导向的安全机制,以更符合青少年发展需求的方式提升LLM的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21496 2026-05-22 cs.LG cs.AI cs.CL 82%

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

HealthCraft: 一种用于急救医学的强化学习安全环境

Brandon Dent

机构 * GOATnote Inc.(GOATnote公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HealthCraft,首个公开的强化学习环境,用于在真实急救医学条件下奖励轨迹级安全,通过FHIR R4世界状态、24个MCP工具和双层评估标准,评估模型在急救任务中的安全性和性能,揭示了模型在多步骤工作流中的安全失败问题。

Comments 16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 62%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07799 2026-05-22 cs.RO cs.AI 57%

Learning Without Losing Identity: Capability Evolution for Embodied Agents

无需失去身份的学习:体素代理的能力进化

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞-沃德大学数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种以能力为中心的体素代理进化范式,通过引入体素能力模块(ECMs)实现持续改进,同时保持代理身份的稳定性,实验表明其在任务成功率和安全性方面优于传统方法。

Comments 12 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21673 2026-05-22 physics.ao-ph cs.CY cs.DL 57%

From Licensing to Open Access: Designing a Sustainable Transition in Operational Weather Data

从许可到开放获取:设计可持续的运营天气数据转型

Emma Pidduck, Umberto Modigliani, Victoria L. Bennett, Fabio Venuti, Florian Pappenberger, Florence Rabier

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文研究了欧洲中期天气预报中心(ECMWF)从受限数据许可模式向CC BY 4.0开放获取的转型,探讨了其设计方法和可持续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21545 2026-05-22 cs.SE cs.AI 57%

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

RefusalBench: 为什么拒绝率错误排名前沿大语言模型在生物研究提示中的表现

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri

机构 * Applied Scientific Intelligence, Inc.(应用科学智能公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出RefusalBench,通过141个提示的47组匹配三元组,评估前沿大语言模型在生物研究提示中的拒绝行为,发现拒绝率错误排名安全校准,揭示了模型在不同风险层级下的表现差异。

Comments 34 pages, 4 figures, 12 tables (10 in main text, 2 in supplementary). Code and data: https://github.com/AppliedScientific/refusalbench

详情

展开后加载摘要…

URL PDF HTML 收藏