Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG
评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估
专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。