arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-05-08 至 2026-05-08 共收录 6 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 6 篇

2605.05758 2026-05-08 cs.CL 78%

BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models

BioTool: 一个全面的工具调用数据集,用于增强大语言模型的生物医学能力

Xin Gao, Ruiyi Zhang, Meixi Du, Peijia Qin, Pengtao Xie

机构 * UC San Diego(圣迭戈大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 医学数据与评测 :biomedical(title,abstract)

AI总结 BioTool通过整合生物医学领域常用工具及高质量查询-API调对,提升大语言模型在生物医学任务中的工具调用能力,实验表明其在生物医学领域表现优于现有商业模型。

Comments Published at ACL 2026; Code and data available at https://github.com/gxx27/BioTool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06643 2026-05-08 cs.CV cs.AI cs.LG cs.MM 62%

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

我们是否在多模态领域泛化中取得进展?一个全面的基准研究

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink

机构 * ETH Zürich(苏黎世联邦理工学院) Zhengzhou University(郑州大学) MBZUAI(马克斯·普朗克人工智能研究所) EPFL(苏黎世联邦理工学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本文通过MMDG-Bench基准测试,评估了多模态领域泛化方法的有效性,发现现有方法在公平比较下进步有限,且存在领域和模态配置差异,揭示了领域泛化仍需进一步改进。

Comments Code: https://github.com/lihongzhao99/MMDG_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05616 2026-05-08 cs.CV cs.LG 62%

RAM-H1200: A Unified Evaluation and Dataset on Hand Radiographs for Rheumatoid Arthritis

RAM-H1200:手部放射影像中类风湿性关节炎的统一评估与数据集

Songxiao Yang, Haolin Wang, Yao Fu, Junmu Peng, Lin Fan, Hongruixuan Chen, Jian Song, Masayuki Ikebe, Shinya Takamaeda-Yamazaki, Masatoshi Okutomi, Tamotsu Kamishima, Yafei Ou

机构 * Institute of Science Tokyo(东京科学研究所) Hokkaido University(北海道大学) Southwest Jiaotong University(西南交通大学) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV、cs.LG

AI总结 本文提出RAM-H1200数据集,用于评估模型在手部放射影像中联合捕捉解剖结构、局部侵蚀性病变和临床标准化RA严重程度的能力,包含1200张放射影像及多级标注。

Comments 50 pages, 24 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05476 2026-05-08 cs.LG cs.AI cs.CL 57%

A Unified Benchmark for Evaluating Knowledge Graph Construction Methods and Graph Neural Networks

面向知识图谱构建方法和图神经网络的统一基准

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise

机构 * Nantes University, LS2N(南特大学,LS2N) National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.LG

AI总结 本文提出一个统一基准,用于评估知识图谱构建方法和图神经网络在噪声文本图上的性能,以及图构建方法在下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 50%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 50%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏