Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵
机构 * Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学)
AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。