Negation Neglect: When models fail to learn negations in training
否定忽视:当模型在训练中无法学习否定时的失败
机构 * University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; Warsaw University of Technology(华沙技术大学) ; NASK National Research Institute(国家研究 institute NASK) ; Truthful AI ; Anthropic ; UC Berkeley(伯克利大学)
AI总结 研究发现,当模型在训练中接触到标记为假的声明时,会错误地认为这些声明为真,且这种现象不仅发生在否定语句中,还扩展到其他认知限定词,影响模型的行为和安全性。