2606.24530
2026-07-07
cs.CL
新提交
79%
NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?
NatureBench: 编码智能体能达到Nature系列论文已发表SOTA水平吗?
Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang
机构
*
Horizon Research(地平线研究)
;
Tsinghua University(清华大学)
专题命中
软件智能体
:coding agent(title,abstract);分类 cs.CL
AI总结
提出跨学科基准NatureBench,包含90个来自Nature系列论文的任务,评估AI编码智能体在真实科学问题上的发现能力。最强模型仅在17.8%任务上超越SOTA,失败主因是方法选择错误和计算预算不足。