arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Pennsylvania(宾夕法尼亚大学)

2026-03-20 至 2026-03-20 共收录 2
2209.04892 2026-03-20 econ.TH cs.GT cs.LG stat.ML

"Calibeating": Beating Forecasters at Their Own Game

Calibeating:在自身游戏中击败预测者

Dean P. Foster, Sergiu Hart

机构 * Hebrew University of Jerusalem, Center for Rationality DP-743(特拉维夫大学, 理性中心 DP-743) University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊)

AI总结 本文提出通过改进校准而不损失专业性的方法,实现预测者之间的竞争,探讨校准与专业性的平衡问题。

Comments Corrected Appendix A.7 + new Appendix A.10. Included: Addendum and Errata to the published journal version (Theoretical Economics, 2023) and to arXiv previous version v2 (2022). Web page: http://www.ma.huji.ac.il/hart/publ.html#calib-beat

Journal ref Theoretical Economics 18 (2023), 4, 1441-1474

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏