UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
UniClawBench:面向实际任务中主动智能体的通用基准测试
机构 * HKU MMLab(香港大学多媒体实验室) ; Meituan(美团)
AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。
Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench