Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols
用于AI控制的游戏:AI部署协议安全评估模型
机构 * University of Oxford(牛津大学) ; Redwood Research(红木研究)
专题命中 其他安全 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出AI-Control Games模型,用于评估不信任AI部署协议的安全性,通过多目标部分可观测随机博弈框架,改进协议设计并分析安全影响。