Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
盲性拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不合法的规则
机构 * Vanderbilt University(范德堡大学) ; University of Michigan(密歇根大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 研究探讨语言模型在面对不公正规则时的拒绝行为,发现模型在无安全风险情况下仍拒绝帮助,且其拒绝行为与规范推理能力脱节。
Comments 9 pages body text, 38 pages total, 4 figures