Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization
为何语义熵失效:面向策略优化的几何感知与校准不确定性
机构 * University of Notre Dame(诺丁汉大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。