Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
元认知作为奖励:通过知识和调节信号强化LLM推理
机构 * Tongji University(同济大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; EPFL(苏黎世联邦理工学院) ; Wuhan University(武汉大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出元认知奖励(MaR)框架,利用元认知知识和调节信号作为过程奖励,提升LLM推理质量,在22个基准上平均提升7.7%。