Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations
无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美
机构 * University of California San Francisco(加州大学旧金山分校) ; Waymark ; University of Pennsylvania(宾夕法尼亚大学) ; Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) ; Stanford University(斯坦福大学)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。
Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage