Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions
努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。