OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces
OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化
机构 * Tongji University(同济大学) ; Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; University of California San Diego(加州大学圣地亚哥分校)
AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。