Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference
超越测试时计算策略:倡导语言模型推理中的能耗-token指标
机构 * Technische Universität Berlin(柏林技术大学)
专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文探讨了在小模型中测试时计算策略的能耗-准确率权衡,提出能耗-token指标和受控推理策略,以实现可持续的AI部署。
Journal ref EuroMLSys2025