ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression
ExpThink:基于经验的强化学习用于自适应思路链压缩
机构 * Baidu Inc.(百度公司) ; Shenzhen University(深圳大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; D-INFK, ETH Zürich(ETH Zürich 计算机科学与技术研究所)
专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出ExpThink框架,通过经验引导奖励塑造和难度自适应优势机制,实现思路链压缩的准确优先、压缩次之的训练目标,实验表明其在多个数学推理基准上显著提升压缩效率和准确性。
Comments 39 pages, 18 figures. Code and model checkpoints will be released upon publication