The Persistent Vulnerability of Aligned AI Systems
对齐AI系统持续的脆弱性
机构 * University College London(伦敦大学学院)
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了自主AI代理在文件系统访问、电子邮件控制和多步骤规划中的部署问题,提出ACDC、LAT等方法以解决AI安全四大难题,通过实验展示对抗性攻击的成功率及模型对齐测试结果。
Comments PhD thesis, University College London, 2025. 157 pages. Supervised by Ricardo Silva