TEMPO: Scaling Test-time Training for Large Reasoning Models
TEMPO:用于大规模推理模型的测试时训练扩展
机构 * Tianjin University(天津大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG
AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。
Comments Preprint