What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
大语言模型预测器知道但不说的内容:探究校准和忠实性的内部表示
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 研究针对预测微调的大语言模型校准和忠实性问题,通过在中间激活上训练表示池探测器,发现其校准效果更好,还能评估CoT忠实性、追踪行为变化等,证明探究内部表示可用于校准、审计和分类语言模型预测器及推理模型。