Efficient Safety Alignment of Language Models via Latent Personality Traits
通过潜在人格特质实现语言模型的高效安全对齐
机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; LawZero ; Université de Montréal(蒙特利尔大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。
Comments 19 pages, 6 figures. Published as a conference paper at COLM 2026