HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification
HorizonMath:通过自动验证衡量AI向数学发现的进步
Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate
机构
*
University of Oxford(牛津大学)
;
Benchmark
;
Harvard University(哈佛大学)
;
Princeton University(普林斯顿大学)
;
Ellison Institute of Technology(Ellison技术研究所)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.LG