Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context
Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。
Comments Accepted by ACL'26 Findings