Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理
机构 * Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Peking University(北京大学) ; Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) ; Microsoft(微软) ; Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)
AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。