Understanding Emergent Misalignment via Feature Superposition Geometry
通过特征叠加几何理解涌现对齐问题
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 研究通过特征叠加几何解释了微调窄任务导致有害行为的机制,发现有害特征在几何上更接近,并通过过滤接近毒特征的数据减少对齐问题。
Comments Accepted to ACL2026