RAS: Measuring LLM Safety Through Refusal Alignment
RAS: 通过拒绝对齐衡量LLM安全性
机构 * National Yang Ming Chiao Tung University ; Hon Hai Research Institute
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG
AI总结 提出白盒评估方法SafeVec,通过内部表示而非生成答案衡量LLM安全性,计算拒绝对齐分数RAS,实现快速、校准的安全评分。