MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models
MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量
机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') ; IIIT Delhi, India(德里印度理工学院) ; Amazon, USA(美国亚马逊) ; Meta, USA(美国Meta) ; Apple, USA(美国苹果)
专题命中 偏好对齐 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。
Comments Submitted to EMNLP 2026