Steering the Language Axis: From Linear Decodability to Causal Control
操控语言轴:从线性可解码到因果控制
机构 * University of California, Santa Cruz(加利福尼亚大学圣克鲁兹分校)
专题命中 模型式强化学习 :latent dynamics(abstract);分类 cs.AI
AI总结 本研究探究大语言模型的语言身份是否可通过紧凑激活方向因果控制,在Qwen、Llama等模型的126万次生成上证实,分离的PCA导出语言轴可可靠操控语言切换,且语言选择具层特异性与语言对依赖性。
Comments 22 pages, 14 figures, Under review