TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
TukaBench: 一个基于文化的非洲语言越狱基准
机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) ; McGill University(麦吉尔大学) ; Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全评测 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。
Comments Under review