Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning
并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号
机构 * Baidu(百度) ; School of Computer Science, Peking University(北京大学计算机科学系) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。