Permutation-Consensus Listwise Judging for Robust Factuality Evaluation
排列一致性列表判断用于鲁棒事实性评估
机构 * App-In Club(App-In俱乐部) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PCFJudge方法,通过多排列重跑列表事实性提示以提高LLM事实性判断的鲁棒性,实验显示其在RewardBench 2 Factuality上显著提升准确率。
Comments Accepted at the Fifth Workshop on Natural Language Generation, Evaluation, and Metrics at ACL 2026