YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning
YFPO:一种基于神经引导奖励的数学推理的初步研究
机构 * Zhejiang University(浙江大学)
专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。
Comments 10 pages, 2figures. Work in progress