Rift: A Conflict Signature for Deception in Language Models
Rift: 语言模型中欺骗行为的冲突特征
机构 * Harmonic Labs
专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。
Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift