Execution-Verified Reinforcement Learning for Optimization Modeling
可验证执行的强化学习用于优化建模
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出EVOM框架,通过将数学规划求解器作为确定性验证器,利用强化学习生成并执行求解代码,实现高效的优化建模。实验表明EVOM在多个数据集上表现优异,支持零样本求解器迁移和低成本适应。