MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based Frameworks
MedicalAgentsBench:复杂医学推理基准——比较内化推理模型与外化智能体框架
机构 * Program in Computational Biology & Biomedical Informatics, Yale University(计算生物学与生物医学信息学项目,耶鲁大学) ; Department of Biomedical Informatics & Data Science, Yale University(生物医学信息学与数据科学系,耶鲁大学) ; Department of Computer Science, Yale University(计算机科学系,耶鲁大学) ; Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) ; Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Bioinformatics, UT Southwestern Medical Center(生物信息学系,德克萨斯西南医学中心)
AI总结 提出MedicalAgentsBench基准(862个复杂临床问题),比较内化推理模型与外化智能体框架在医学推理中的表现,发现两者效果可叠加,最优组合为o3-mini+MDAgents(准确率35.1%)。