Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models
熵梯度反转:迈向大型推理模型的内部机制
机构 * National University of Singapore(新加坡国立大学) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。
Comments 15 pages, 5 figures, 8 tables