Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth
使用确定性真实数据评估长文本生成中语言模型的不确定性
机构 * Technion(技术学院) ; Nvidia(英伟达)
专题命中 知识编辑与模型理解 :LLM(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT