Containment Verification: AI Safety Guarantees Independent of Alignment
包含性验证:与对齐无关的AI安全保证
机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title);分类 cs.AI
AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。
Comments 14 pages