JobBench: Aligning Agent Work With Human Will
JobBench:使智能体工作符合人类意愿
机构 * University of Washington(华盛顿大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Northwestern University(西北大学) ; University of Notre Dame(圣母大学) ; University of California, Berkeley(加州大学伯克利分校) ; Michigan State University(密歇根州立大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Bake AI ; King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) ; Western Washington University(西雅图华盛顿大学) ; University of Chicago(芝加哥大学)
AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。