Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
相同问题,不同答案:超越准确率评估大语言模型的可靠性
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。