Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety
在自毁之前检查自己:选择性退出提升LLM智能体安全性
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL
AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。
Comments Reliable ML and Regulatable ML workshops, Neurips 2025