arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Oxford(牛津大学)

2026-07-31 至 2026-07-31 共收录 2
2607.26654 2026-07-31 cs.CL cs.AI cs.CY cs.LG 版本更新

Constitutional Midtraining: Content Presence Drives Alignment Gains

宪法式中间训练:内容存在驱动对齐增益

Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt

机构 * University of Oxford(牛津大学) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Geodesic Research Oxford Internet Institute, University of Oxford(牛津大学互联网研究院)

AI总结 该研究提出宪法式中间训练方法,在中间训练中插入基于原则价值观的内容,可提升模型对齐的泛化性与持久性,削弱SFT灌输的敲诈倾向且不造成能力损失,为以SFT为中心的流程提供低成本补充方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05905 2026-07-31 cs.LG math.OC 版本更新

Quadratic Objective Perturbation: Curvature-Based Differential Privacy

二次目标扰动:基于曲率的差分隐私

Daniel Cortild, Coralia Cartis

机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所)

AI总结 本文提出二次目标扰动(QOP),通过引入随机二次形式扰动目标函数,利用曲率特性实现强凸性和稳定性,从而在较弱假设下实现$(\varepsilon, δ)$-差分隐私,并提供实用性和数值比较。

详情

展开后加载摘要…

URL PDF HTML 收藏