GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
GT-HarmBench:通过博弈论视角评估AI安全风险
机构 * ETH Zürich(苏黎世联邦理工学院) ; Berea College(贝雷学院) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。