Harnessing the Latent Space: From Steering Vectors to Model Calibrators for Control and Trust
利用潜在空间:从引导向量到模型校准器以实现控制与信任
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出利用潜在空间中的引导向量控制语言模型行为,并开发基于潜在空间的模型校准器评估输出可信度,从而增强模型的可控性与可靠性。
Comments ACL 2026 (BigPicture Workshop)