An Expert Schema for Evaluating Large Language Model Errors in Scholarly Question-Answering Systems
评估学术问答系统中大语言模型错误的专家模式
机构 * University of Minnesota(明尼苏达大学) ; NASA Langley Research Center(NASA兰利研究中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 本文提出了一种评估学术问答系统中大语言模型错误的专家模式,通过与领域专家合作识别错误模式,并探讨了支持专家评估LLM输出的个性化工具机会。
Comments 24 pages, 2 figures. Accepted at ACM CHI conference on Human Factors in Computing Systems, 2026