WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
WildClawBench: 一个用于真实世界、长周期代理评估的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。
Comments Github link: https://github.com/internlm/WildClawBench