Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于大语言模型
机构 * SenseTime(商汤科技) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出动态认知熵编排的可擦除强化学习(E³RL),通过将模型内生的局部自回归交叉熵作为认知不确定性坐标,利用分段自适应动态阈值和优势分配精准切除逻辑缺陷并重用KV缓存,解决长序列推理中的自回归级联崩溃问题。