Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment
对齐预训练:人工智能 discourse 导致自我实现的(不)对齐
机构 * Geodesic Research(Geodesic研究机构) ; UK AI Security Institute(英国人工智能安全研究所) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。