ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End?
ORAgentBench: LLM代理能否解决具有挑战性的端到端运筹学任务?
机构 * Southeast University(东南大学) ; Waseda University(早稻田大学) ; Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ORAgentBench基准,评估LLM代理在端到端运筹学任务中的表现,发现当前代理通过率仅35.51%,主要受策略性弱点限制。
Comments 31 pages, preprint, v1