COMPASS: Benchmarking Constrained Optimization in LLM Agents
COMPASS:评估LLM代理在约束优化中的表现
机构 * Harvard University(哈佛大学) ; Apple(苹果公司) ; Virginia Tech(弗吉尼亚理工学院) ; UIUC(伊利诺伊大学香槟分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 软件智能体 :coding agent(abstract);分类 cs.LG
AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。