Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review
AI能否评估AI科学家?基于自动化多模型评审的自主研究生成系统基准研究
机构 * Technion(以色列理工学院) ; Sakana AI ; FARS
AI总结 该研究针对AI科学家系统的评估难题,提出基于多模型LLM的自动化评审基准,发现FARS基准论文表现最优,Gemini与Claude评估一致性强,GPT-5.4标准不同,建立了首个定量基准。