Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability
大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Purdue University(普渡大学) ; Meta ; Apple(苹果公司) ; Wright State University(怀特州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。