Social Pressure Breaks Majority Voting in LLM Safety Panels
社交压力会破坏大语言模型安全评审团的多数投票机制
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Amazon(亚马逊)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL
AI总结 该研究发现,在LLM安全评审团中,同行的错误标签断言会大幅提升误报率,且评审员更易追随“不安全”方向,多数投票机制会因社交压力失效,还提供了部署前诊断方法。