OpenSafeIntent: Evaluating Intent-Calibrated Safe Completion Across Dual-Use Prompt Sets
OpenSafeIntent: 评估跨双用途提示集的意图校准安全补全
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) ; Department of CSE Korea University(计算机科学与工程系韩国大学)
AI总结 提出OpenSafeIntent基准,通过控制任务不变而改变意图的提示集,评估模型在意图变化时是否校准辅助行为,发现提示级安全掩盖重要失败。
Comments Preprint