MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
MedHopQA: 一种以疾病为中心的多跳推理基准和评估框架,用于基于大语言模型的生物医学问答
Rezarta Islamaj, Robert Leaman, Joey Chan, Nicholas Wan, Qiao Jin, Natalie Xie, John Wilbur, Shubo Tian, Lana Yeganova, Po-Ting Lai, Chih-Hsuan Wei, Yifan Yang, Yao Ge, Qingqing Zhu, Zhizheng Wang, Zhiyong Lu
机构
*
National Library of Medicine, Division of Intramural Research(国家医学图书馆,院内研究部)
;
University of Illinois at Urbana-Champaign, Department of Computer Science(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
;
University of Michigan Medical School(密歇根大学医学院)
BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding
BARISTA:一种多任务第一人称视角基准,用于组合视觉理解
Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert
机构
*
Ramblr.ai Research(Ramblr.ai 研究院)
;
Technical University of Clausthal(Clausthal 技术大学)
CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography
CheXTemporal:用于胸部X光影像中时间感知推理的数据集
Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz
机构
*
Stanford University(斯坦福大学)
;
University of Oxford(牛津大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
HOPPR
;
University Hospital Zurich(苏黎世大学医院)
Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering
BioCreative IX MedHopQA 轨道概述:轨道描述、参与及多跳医学问答系统评估
Rezarta Islamaj, Joey Chan, Robert Leaman, Jongmyung Jung, Hyeongsoon Hwang, Quoc-An Nguyen, Hoang-Quynh Le, Harikrishnan Gurushankar Saisudha, Ganesh Chandrasekar, Rustam R. Taktashov, Nadezhda Yu. Bizyukova, Sofia I. R. Conceição, Paulo R. C. Lopes, Reem Abdel Salam, Mary Adewunmi, Zhiyong Lu
机构
*
National Library of Medicine (NLM), National Institutes of Health (NIH)(美国国家医学图书馆(NLM)、国家卫生研究院(NIH))
;
University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Korea University(韩国大学)
;
VNU University of Engineering and Technology, Hanoi, Vietnam(越南河内工程大学)
;
Concordia University, Montreal, QC, CA(蒙特利尔大学)
;
Institute of Biomedical Chemistry (IBMC), 10 bld. 8, Pogodinskaya str., 119121 Moscow, Russia(俄罗斯生物医学化学研究所(IBMC))
;
LASIGE, Departamento de Informática, Faculdade de Ciências, Universidade de Lisboa, 1749-016 Lisbon, Portugal(葡萄牙里斯本大学 LASIGE 实验室)
;
Faculty of Engineering, Computer Engineering Department Cairo University(埃及开罗大学工程学院)
;
Menzies School of Health Research, Charles Darwin University, NT, Australia(澳大利亚查尔斯达尔文大学梅恩兹健康研究中心)
;
CaresAI, Australia(澳大利亚 CaresAI)
专题命中
医学数据与评测
:biomedical(abstract)
AI总结
本文介绍了BioCreative IX MedHopQA共享任务,旨在评估大型语言模型在多跳推理中的表现,通过构建1000个挑战性问题,展示了检索增强生成策略的重要性,并提供了公开数据集和评估结果。