2604.02368
2026-04-22
cs.AI
cs.CL
87%
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
Xpertbench:基于评分标准的专家级任务
Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xinyu Chen, Yida Ding, Tianci He, Jiani Hou, Liang Hu, Ziyun Huang, Yongzhe Hui, Jianpeng Jiao, Chennan Ju, Yingru Kong, Yiran Li, Jiashuo Liu, Mengyun Liu, Luyao Ma, Fei Ni, Yiqing Ni, Pengbo Niu, Yueyan Qiu, Yanle Ren, Xinyu Shen, Zilin Shi, Zaiyuan Wang, Wenjie Yue, Chun Zhang, Shiyu Zhang, Xinyi Zhang, Kaiwen Zhao, Zhenwei Zhu, Shanshan Wu, Qi Zhao, Wenhao Huang
专题命中
领域大模型
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结
XpertBench通过精心设计的高保真任务评估LLM在专业领域的能力,揭示了当前AI系统在专家级任务上的性能瓶颈,展示了模型在不同领域中的表现差异。