Adversarial Prompting Framework for AI Safety Assessment
用于人工智能安全评估的对抗性提示框架
机构 * Microsoft(微软)
专题命中 越狱攻击 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。
Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India