OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现
机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。
Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/