MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop
MacAgentBench: 在真实macOS桌面上基准测试AI代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Tsinghua University(清华大学)
AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。