给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
在18种Agent—模型配置上,提供完整方法指导时平均分为50.91,只给方法名称时降到29.10,连方法也要AI自行确定时降至26.62。末档相较完整指导减少24.29分,降幅约47.7%,论文据此判断当前系统仍强依赖人类研究路线。
不是再答一道题,而是完成一个研究项目
常见知识与推理基准给出边界清楚的问题,模型在已有知识中寻找答案。科研项目包含选题解释、方法选择、实验实现、故障排查、结果分析和证据提交,任一环节出错都可能让最终结论无法验证。
ASI-Bench覆盖11个科学领域的60项任务,由40多名专家投入超过31000小时构建。任务以项目为单位,不只检查最终文字,还要求系统执行分析或实验并提交可被评分器复核的产物。
基准结果显示,随着人类方法指导减少,多套Agent—模型配置的项目得分明显下降。
作者对任务进行专家评审、AI辅助审计、沙箱执行和评分器验证。多层检查是为减少“文字看起来合理但结果无法运行”的情况,也让评分更多落到可复核输出,而不是评审者对文风的主观偏好。
三档提示逐步撤掉人类路线
基准在同一研究项目内逐步减少方法信息。第一档提供完整方法指导,系统主要负责实施;第二档只指定方法,让系统补齐步骤;第三档连方法都不提供,Agent必须判断采用哪条研究路线并完成执行。
任务经过专家设计、审计、沙箱执行与评分器验证,确保输出可以被复查。
这样的对照把“知道怎么做”和“自己决定怎么做”分开。平均分从50.91降到29.10,说明把方法名称扩展成可靠实验计划已经损失大量表现;继续撤掉方法后降到26.62,暴露的是研究方向选择与自主探索仍不稳定。
分数没有降到零,表示系统在部分任务中能自行推进。它也不能被解读为“AI完成了26.62%的科学发现”:基准汇总多项评分,任务领域、难度和可验证方式均由作者设计,数字只在该协议内成立。
18套配置都未摆脱指导依赖
作者评估18种先进Agent—模型组合。总体排序会随任务和配置变化,但共同趋势是指导越少,平均表现越低。论文把这条曲线作为核心结论,而不是挑选某个模型的单项最好成绩。
结果总览按任务领域和系统配置汇总表现,用于观察不同研究类型的难度差异。
项目级任务还放大了长链路误差。模型可能提出合理方法,却在代码、数据、工具或统计检验处失败;也可能生成可运行结果,但研究问题与方法并不匹配。只看最后答案的基准无法区分这些失败来源。
成本也是评价边界。更长推理、更多工具调用和重复实验可能提高成功率,却增加Token、运行时间与外部服务费用。基准记录这类消耗,为比较“多花多少资源换多少研究进展”提供起点。
成本图记录不同系统完成项目时的Token和运行开销,性能比较需要结合资源消耗。
从基准走向可审计科研协作
ASI-Bench更直接的应用是评估科研Agent的工作分工。系统可以先在完整指导档验证执行可靠性,再逐步开放方法设计权;研究者能据不同档位的失败定位问题出在计划、实现还是结果核验。
后续需要外部团队提交新任务、复现评分器,并检查任务是否泄漏到训练数据。高风险领域还应加入伦理审批、数据许可和安全约束,不能只因沙箱结果可运行就允许自动部署。当前结果支持的判断很明确:AI已经能承担部分研究执行,但从问题出发自主选择方法并完成端到端项目,仍远未稳定。