arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2510.08240 2026-04-22 cs.CL 89%

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

对齐之舞:联合训练代理以安全协作

Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19024 2026-04-22 cs.LG 84%

Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

基于人类反馈的安全强化学习策略梯度对偶方法

Qiang Liu, Adrienne Kline, Ermin Wei

专题命中 安全训练 :RLHF(summary_cn,abstract);harmlessness(abstract);分类 cs.LG

AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG 73%

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19018 2026-04-22 cs.LG cs.AI cs.SY eess.SY math.OC stat.ML 62%

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

大模型的局部线性性使基于模型的线性最优控制能够实现激活引导

Julian Skifstad, Xinyue Annie Yang, Glen Chou

机构 * Georgia Institute of Technology, Atlanta, GA, USA. Schools of Electrical and Computer Engineering(佐治亚理工学院,亚特兰大,GA,美国。电气与计算机工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过利用大模型层间动力学的局部线性特性,本文将LLM推理建模为线性时变动态系统,采用线性二次调节器计算反馈控制器,实现激活的闭环控制,具有低计算开销和无离线训练的优势,同时提供理论误差界保证控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13281 2026-04-22 cs.AI cs.CL 62%

RepIt: Steering Language Models with Concept-Specific Refusal Vectors

RepIt:通过概念特定拒绝向量引导语言模型

Vincent Siu, Nathan W. Henry, Nicholas Crispino, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 RepIt通过隔离语言模型激活中的概念特定表示,揭示当前安全评估的漏洞,展示如何利用少量资源实现针对特定概念的拒绝抑制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 57%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16654 2026-04-22 cs.CL 57%

IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language

IYKYK (但AI不): 自动内容审查未能捕捉社区对重新获得语言的异质态度

Christina Chance, Rebecca Pattichis, Arjun Subramonian, James He, Shruti Narayanan, Saadia Gabriel, Kai-Wei Chang

机构 * University of California Los Angeles(加州大学洛杉矶分校) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究通过定量和定性方法分析LGBTQIA+、黑人和女性社区对重新获得污辱词的态度,发现注释者之间一致性低,且自动审查工具与人工判断不一致,揭示了重新获得污辱词的主观性和语境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 57%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14387 2026-04-22 cs.AI 57%

SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention

SEAT:稀疏实体感知调谐以实现知识适应同时保持认知回避

William F. Shen, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Meta

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 SEAT通过稀疏调谐和实体扰动KL正则化,在保持认知回避能力的同时提升知识获取,无需对齐数据或后续重对齐,有效提升未知查询的人工评估回避率。

详情

展开后加载摘要…

URL PDF HTML 收藏