What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors
模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型
机构 * Emory University(埃默里大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。