HMPO: Hybrid Median-length Policy Optimization for Chain-of-Thought Compression
HMPO: 用于思维链压缩的混合中位数长度策略优化
机构 * Li Auto Inc.(Li Auto公司)
AI总结 提出HMPO,一种单阶段强化学习框架,通过自适应中位数预算、余弦衰减令牌奖励和乘法奖励公式,在数学数据上训练后实现19%-46%的令牌压缩且精度损失极小,并泛化至多种任务。
大厂专区
HMPO: 用于思维链压缩的混合中位数长度策略优化
机构 * Li Auto Inc.(Li Auto公司)
AI总结 提出HMPO,一种单阶段强化学习框架,通过自适应中位数预算、余弦衰减令牌奖励和乘法奖励公式,在数学数据上训练后实现19%-46%的令牌压缩且精度损失极小,并泛化至多种任务。