Pitfalls in Evaluating Interpretability Agents
评估可解释性代理中的陷阱
机构 * Kempner Institute at Harvard University(哈佛大学 Kempner 机构) ; Northeastern University(东北大学) ; Boston University(波士顿大学) ; MIT(麻省理工学院)
AI总结 本文研究了自动化电路分析中可解释性代理的评估挑战,提出基于模型组件功能互换性的无监督内在评估方法,揭示了复制评估的局限性。