arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-06-01 至 2026-06-01 共收录 7 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 临床大模型 7 篇

2605.30646 2026-06-01 cs.CL cs.AI 83%

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

同一患者,不同措辞,不同诊断?评估临床大语言模型中的语义稳定性

Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

机构 * Department of Computer Science and Engineering, College of Engineering, Qatar University(卡塔尔大学计算机科学与工程系) College of Science and Engineering, Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学(HBKU)理学院) Primary Health Care Corporation (PHCC)(初级卫生保健公司) Birmingham City University(伯明翰城市大学)

专题命中 临床大模型 :clinical LLM(title);diagnosis(title)

AI总结 针对临床大语言模型对语义等价但措辞不同的提示敏感的问题,提出基于自然语言推理的语义验证框架和三个量化指标,评估16个开源通用与医学模型,发现领域专业化并不一致地提升或降低鲁棒性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16215 2026-06-01 cs.AI cs.CL 71%

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

完全开放的Meditron:临床大语言模型的可审计流水线

Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

机构 * EPFL(苏黎世联邦理工学院)

专题命中 临床大模型 :clinical LLM(title)

AI总结 提出首个完全开放的临床大语言模型构建流水线Fully Open Meditron,通过可审计的数据集、可复现的训练框架和对齐评估协议,在不牺牲可审计性和可复现性的前提下实现了领域最新性能。

Comments Preprint. 31 pages, 10 figures. Code, models, and data: https://github.com/EPFLiGHT/FullyOpenMeditron

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30637 2026-06-01 cs.AI 67%

EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

EHRBench: 基于电子健康记录的自动化可靠临床决策基准测试,用于大语言模型

Yuzhang Xie, Keqi Han, Yunpeng Xiao, Hejie Cui, Guanchen Wu, Ziyang Zhang, Kai Shu, Jiaying Lu, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学)

专题命中 临床大模型 :diagnosis(abstract);biomedical(abstract)

AI总结 提出EHRBench,通过EHR-LLM-KB交互流水线自动构建近百万问答对,涵盖诊断、治疗和预后三大临床决策任务,系统评估30余种LLM的性能与鲁棒性。

Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Datasets and Benchmarks Track, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30529 2026-06-01 cs.CL cs.AI cs.LG 57%

Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages

通用嵌入还是特定嵌入,哪个更好?非英语语言临床编码搜索的实证研究

David Rey-Blanco, Roberto Cruz

机构 * TietAI

专题命中 临床大模型 :biomedical(abstract);分类 cs.LG

AI总结 本研究通过使用大型生成语言模型生成的合成数据微调双语编码器,构建两阶段检索器,解决了非英语语言临床编码检索中召回率下降的问题,并在多语言基准上取得了优于BioBERT-ST的性能。

Comments 24 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31567 2026-06-01 stat.ME stat.AP 50%

Addressing errors in multiple variables using generalized raking and cumulative probability models

使用广义分层和累积概率模型解决多变量中的错误

Eric S. Kawaguchi, Chun Li, Frank E. Harrell, Pamela A. Shaw, Thomas Lumley, Bryan E. Shepherd

专题命中 临床大模型 :biomedical(abstract)

AI总结 本研究针对电子健康记录等常规收集数据中的错误,提出使用广义分层结合累积概率模型来校准验证子样本权重,从而减少偏差并提高估计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30680 2026-06-01 cs.AI cs.MA 50%

Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response

战略提供者响应下的策略即代码搜索中的医疗机制

Zihan Wang, Xiang Xu, Hongyuan Zha, Wenhao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongji University(同济大学)

专题命中 临床大模型 :healthcare AI(abstract)

AI总结 将医疗机制设计转化为语言模型的程序合成,通过多智能体模拟器Medi-Sim评估策略提供者响应下的均衡,并利用LLM引导的进化代码搜索合成可检查的混合目标程序。

Comments 32 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 50%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 临床大模型 :medical AI(abstract)

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏