UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention
你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。