Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试
机构 * Google DeepMind(谷歌DeepMind) ; University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) ; Google(谷歌) ; University of Missouri Columbia(密苏里大学哥伦比亚分校) ; Chunghwa Telecom Laboratories(春木电信实验室) ; University of Southern California(南加州大学) ; Polytechnique Montreal(蒙特利尔理工学院) ; Nutanix ; ThinkEvolve Labs(ThinkEvolve实验室) ; UCL(伦敦大学学院) ; Infocomm Media Development Authority(信息通信媒体发展局) ; Monark Health(Monark健康) ; Seoul National University(首尔国立大学) ; Microsoft(微软) ; Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; Microsoft Research India(微软印度研究院) ; Stanford University(斯坦福大学) ; Argonne National Laboratory(阿贡国家实验室) ; University of Oxford(牛津大学) ; KAIST(韩国科学技术院) ; Yonsei University(延世大学) ; Amazon(亚马逊) ; UIUC(伊利诺伊大学香槟分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Xenoscube Inc.(Xenoscube公司) ; Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) ; MLCommons ; CommonGround ; Artifex Labs(Artifex实验室)
AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。