MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions
MIRAGE: 审计前沿大语言模型在推理、智能体与时间耦合条件下的反穆斯林偏见
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 规划决策 :agentic(title,abstract);分类 cs.LG
AI总结 提出MIRAGE基准,包含1200个提示,覆盖直接完成、思维链推理和模拟智能体决策三种部署场景,发现思维链放大偏见、智能体决策存在不对称性、偏见与检索新闻时间耦合,现有缓解措施效果有限。