Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments
自然语言解释中的判断质量测量:来自预测锦标赛的证据
Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger
机构
*
Forecasting Research Institute(预测研究所)
;
Good Judgment Inc(Good Judgment公司)
;
University of Toronto(多伦多大学)
;
Vector Institute for Artificial Intelligence(向量人工智能研究所)
;
Stanford University(斯坦福大学)
;
School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院)
;
Federal Reserve Bank of Chicago(芝加哥联邦储备银行)
;
Federal Reserve System(联邦储备系统)
Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing
通过局部分支路由实现高效且可训练的语言模型测试时扩展
Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang
机构
*
Northwestern University(西北大学)
;
Rutgers University(罗格斯大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
LMSYS Org(LMSYS组织)
;
Tilde Research(Tilde研究)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
;
University of Toronto(多伦多大学)
;
University of British Columbia(不列颠哥伦比亚大学)
;
University of California, San Diego(加州大学圣迭戈分校)