The Art of Efficient Reasoning: Data, Reward, and Optimization
高效推理的艺术:数据、奖励与优化
机构 * The University of Hong Kong(香港大学) ; LLM Department, Tencent(腾讯人工智能实验室)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文系统研究了大型语言模型的高效推理机制,通过精细化指标评估发现训练过程分为长度适应与推理优化两阶段,提出保持正奖励密度以避免短即正确陷阱,并验证了在不同领域和难度下的通用性。
Comments Tech Report, Insights on Efficient Reasoning via Reward Shaping