SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models
SAE-SSV: 在稀疏表示空间中进行监督引导以可靠控制语言模型
机构 * NJIT(新 jersey 理工学院) ; Rutgers University(罗格斯大学) ; Cisco(思科公司)
AI总结 SAE-SSV通过在稀疏表示空间中训练监督引导向量,实现对语言模型行为的可靠控制,提高了生成任务的成功率和可解释性。
Comments Accepted by EMNLP 2025