ConfidenceBench: Evaluating Confidence Calibration in Large Language Models
ConfidenceBench:评估大语言模型中的置信度校准
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; New York University(纽约大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。