Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control
基于验证器的热能存储控制推理模型强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title);planning(abstract);分类 cs.LG
AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。
Comments 29 pages, 8 figures