arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-15 至 2026-05-15 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2510.23868 2026-05-15 cs.LG cs.CL 93%

GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA

GIFT: 组相对隐式微调整合GRPO与DPO和UNA

Zhichao Wang

机构 * Inflection AI

专题命中 偏好对齐 :DPO(title,title_cn);RLHF(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 GIFT结合GRPO组采样、DPO隐式奖励和UNA的隐式与显式优势MSE,通过z-score标准化消除DPO隐式奖励中的不可行分区函数Z(x)和RLHF/RLVR目标中的KL系数β,以组相对隐式微调解决相同参数策略族,用提示适应的β(x)替代外部调优的β。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00977 2026-05-15 cs.LG cs.CL 88%

It Takes Two: Your GRPO Is Secretly DPO

两人即可:你的GRPO其实暗含DPO

Yihong Wu, Liheng Ma, Lei Ding, Muzhi Li, Xinyu Wang, Kejia Chen, Zhan Su, Zhanguang Zhang, Chenyang Huang, Yingxue Zhang, Mark Coates, Jian-Yun Nie

机构 * UdeM(蒙特利尔大学) McGill(麦吉尔大学) Mila(Mila人工智能研究院) UManitoba(曼尼托巴大学) CUHK(香港中文大学) ZJU(浙江大学) UAlberta(阿尔伯塔大学) Amii(阿米人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出2-GRPO,通过仅两个rollouts构建对比信号,理论分析显示其性能接近16-GRPO,训练效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14912 2026-05-15 cs.AI cs.CY cs.HC cs.LG 87%

From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

从阿谀共识到多元修复:为何AI对齐必须显现分歧

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Responsible Technology Institute, University of Oxford(牛津大学负责任技术研究所)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出多元对齐需通过对话机制表面价值冲突,提出多元修复评分指标,探讨部署阶段的治理层对多元主义的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13875 2026-05-15 cs.GT 78%

Common-agency Games for Multi-Objective Test-Time Alignment

多目标测试时对齐的共同代理博弈

Baiting Chen, Tong Zhu, Rui Yu, Xiaowu Dai

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出CAGE框架,通过游戏理论实现多目标测试时对齐,无需重新训练,支持灵活的权衡和弱到强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13069 2026-05-15 cs.CY 57%

Not All Anquan Is the Same: A Terminological Proposal for Chinese Computer Science and Engineering

并非所有安全都是相同的:对中国计算机科学与工程术语的提案

Xingyu Zhao

专题命中 偏好对齐 :safety(abstract);分类 cs.CY

AI总结 本文提出将安全与安保区分,以提升术语准确性,应对安全与安保在标准、协作和学术写作中的概念混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏