SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?
SoundnessBench:你的AI科学家真的能区分好的研究想法和坏的吗?
机构 * University of Maryland College Park(马里兰大学College Park分校)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出SoundnessBench基准,通过ICLR提交的1099个机器学习研究提案评估LLM判断研究想法方法论合理性的能力,发现当前LLM存在普遍乐观偏差,无法可靠作为科学严谨性的独立初筛评估者。
Comments Project Page: https://hosytuyen.github.io/projects/SoundnessBench