The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models
大语言模型在文化禁忌安全方面的“知识-行为差距”
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) ; Huawei(华为)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。