When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
当大语言模型达成一致时,它们是正确的吗?将自一致性和跨模型一致性作为置信信号进行审计
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 研究探讨大语言模型一致性与正确性的关系,通过大规模交叉运行研究,发现一致性是正确性的条件代理,对不饱和中层模型和计算分配较有用,对最一致的前沿模型存在过度自信问题,还公开了相关数据。