arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2119 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2119 篇

2603.22935 2026-03-25 cs.AI cs.HC 71%

Ran Score: a LLM-based Evaluation Score for Radiology Report Generation

Ran Score:一种基于大语言模型的放射学报告生成评估分数

Ran Zhang, Yucong Lin, Zhaoli Su, Bowen Liu, Danni Ai, Tianyu Fu, Deqiang Xiao, Jingfan Fan, Yuanyuan Wang, Mingwei Gao, Yuwan Hu, Shuya Gao, Jingtao Li, Jian Yang, Hong Song, Hongliang Sun

机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) Department of Radiology, China-Japan Friendship Hospital (Institute of Clinical Medical Sciences), Beijing 100029, China(日本友谊医院放射科(临床医学科学院),北京100029,中国) Chinese Academy of Medical Science & Peking Union Medical College, Beijing 100730, China(中国医学科学院 & 首都医科大学,北京100730,中国) Department of Radiology, Peking University China-Japan Friendship School of Clinical Medicine, Beijing 100029, China(北京大学日本友谊学校临床医学系放射科,北京100029,中国) Department of Gastroenterology, China-Japan Friendship Hospital, Beijing 100029, China(日本友谊医院消化内科,北京100029,中国) NHC Key Laboratory of Clinical Big Data Standardization & Integration, Beijing 100029, China(国家卫生健康委员会临床大数据标准化与整合关键实验室,北京100029,中国)

专题命中 医学数据与评测 :radiology(title)

AI总结 本文提出Ran Score,一种基于大语言模型的放射学报告生成评估指标,通过结合人类专业知识和大型语言模型,改进多标签发现提取,并在多个数据集中验证其有效性。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15479 2026-03-13 cs.CL cs.AI 71%

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

在生物医学和多领域背景下对LLM进行成对因果发现的基准测试

Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

专题命中 医学数据与评测 :biomedical(title)

AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08275 2026-02-16 cs.CL cs.AI 71%

MLLM-CTBench: A Benchmark for Continual Instruction Tuning with Reasoning Process Diagnosis

MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断

Haiyun Guo, Zhiyan Hou, Yandu Sun, Jinghan He, Yu Chen, Yuzhe Zhou, Yuheng Jia, Jinqiao Wang, Tat-Seng Chua

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 医学数据与评测 :diagnosis(title)

AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01496 2026-02-02 cs.CV cs.LG eess.IV stat.ML 71%

Fréchet Radiomic Distance (FRD): A Versatile Metric for Comparing Medical Imaging Datasets

Fréchet Radiomic Distance (FRD): 一种用于比较医学影像数据集的多功能度量

Nicholas Konz, Richard Osuala, Preeti Verma, Yuwen Chen, Hanxue Gu, Haoyu Dong, Yaqian Chen, Andrew Marshall, Lidia Garrucho, Kaisar Kushibar, Daniel M. Lang, Gene S. Kim, Lars J. Grimm, John M. Lewin, James S. Duncan, Julia A. Schnabel, Oliver Diaz, Karim Lekadir, Maciej A. Mazurowski

专题命中 医学数据与评测 :medical image(abstract,comments);分类 cs.CV、cs.LG、eess.IV

AI总结 FRD是一种专为医学影像设计的感知度量标准,通过标准化且可解释的图像特征提升医学影像分析中的比较和评估能力。

Comments Codebase for FRD computation: https://github.com/RichardObi/frd-score. Codebase for medical image similarity metric evaluation framework: https://github.com/mazurowski-lab/medical-image-similarity-metrics

Journal ref Medical Image Analysis, 103943 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04210 2025-12-05 cs.AI cs.CL cs.CY 71%

Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment

通过迭代偏好对齐平衡医疗AI助手的安全性与帮助性

Huy Nghiem, Swetasudha Panda, Devashish Khatwani, Huy V. Nguyen, Krishnaram Kenthapadi, Hal Daumé

机构 * University of Maryland(马里兰大学) Oracle Labs(Oracle实验室) Oracle Health AI(Oracle健康AI)

专题命中 医学数据与评测 :healthcare AI(title)

AI总结 本文提出通过迭代偏好对齐框架提升医疗AI助手的安全性与帮助性,通过KTO和DPO优化改进模型,提升有害查询检测性能并平衡安全与效用。

Comments ML4H 2025 Proceedings, Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01053 2025-11-04 cs.CL 71%

Building a Silver-Standard Dataset from NICE Guidelines for Clinical LLMs

Qing Ding, Eric Hua Qing Zhang, Felix Jozsa, Julia Ive

专题命中 医学数据与评测 :clinical LLM(title)

Comments Submitted to EFMI Medical Informatics Europe 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17163 2025-06-23 cs.AI 71%

The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making

Abinitha Gourabathina, Yuexing Hao, Walter Gerych, Marzyeh Ghassemi

专题命中 医学数据与评测 :clinical LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00216 2025-05-15 cs.AI 71%

The Explanation Necessity for Healthcare AI

Michail Mamalakis, Héloïse de Vareilles, Graham Murray, Pietro Lio, John Suckling

机构 * University of Cambridge(剑桥大学)

专题命中 医学数据与评测 :healthcare AI(title)

Comments accepted paper in IEEE CITREx 2025 : IEEE Symposium on Explainable, Responsible, and Trustworthy Computational Intelligence

Journal ref 2025 IEEE Symposium on Trustworthy, Explainable and Responsible Computational Intelligence (CITREx Companion)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05349 2024-11-11 cs.AI cs.DC 71%

Enhancing Cluster Resilience: LLM-agent Based Autonomous Intelligent Cluster Diagnosis System and Evaluation Framework

Honghao Shi, Longkai Cheng, Wenli Wu, Yuhang Wang, Xuan Liu, Shaokai Nie, Weixv Wang, Xuebin Min, Chunlei Men, Yonghua Lin

专题命中 医学数据与评测 :diagnosis(title)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20003 2024-10-29 cs.CY 71%

Federated Anomaly Detection for Early-Stage Diagnosis of Autism Spectrum Disorders using Serious Game Data

Nikolaos Pavlidis, Vasileios Perifanis, Eleni Briola, Christos-Chrysanthos Nikolaidis, Eleftheria Katsiri, Pavlos S. Efraimidis, Despina Elisabeth Filippidou

专题命中 医学数据与评测 :diagnosis(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16845 2024-10-24 cs.CL 71%

RaTEScore: A Metric for Radiology Report Generation

Weike Zhao, Chaoyi Wu, Xiaoman Zhang, Ya Zhang, Yanfeng Wang, Weidi Xie

专题命中 医学数据与评测 :radiology(title)

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14988 2024-09-24 cs.CL 71%

Beyond Fine-tuning: Unleashing the Potential of Continuous Pretraining for Clinical LLMs

Clément Christophe, Tathagata Raha, Svetlana Maslenkova, Muhammad Umar Salman, Praveen K Kanithi, Marco AF Pimentel, Shadab Khan

专题命中 医学数据与评测 :clinical LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08624 2024-08-19 cs.CL cs.AI 71%

RealMedQA: A pilot biomedical question answering dataset containing realistic clinical questions

Gregory Kell, Angus Roberts, Serge Umansky, Yuti Khare, Najma Ahmed, Nikhil Patel, Chloe Simela, Jack Coumbe, Julian Rozario, Ryan-Rhys Griffiths, Iain J. Marshall

专题命中 医学数据与评测 :biomedical(title)

Comments Accepted at AMIA Annual Symposium 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20613 2024-08-13 cs.CL 71%

FineRadScore: A Radiology Report Line-by-Line Evaluation Technique Generating Corrections with Severity Scores

Alyssa Huang, Oishi Banerjee, Kay Wu, Eduardo Pontes Reis, Pranav Rajpurkar

专题命中 医学数据与评测 :radiology(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08084 2024-05-15 cs.CR 71%

PrivFED -- A Framework for Privacy-Preserving Federated Learning in Enhanced Breast Cancer Diagnosis

Maithili Jha, S. Maitri, M. Lohithdakshan, Shiny Duela J, K. Raja

专题命中 医学数据与评测 :diagnosis(title)

Comments Presented in ICIITB 2024 organized by Modern College of Business and Science, Oman

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09101 2023-10-16 cs.CR cs.AI 71%

Privacy-Preserving Encrypted Low-Dose CT Denoising

Ziyuan Yang, Huijie Huangfu, Maosong Ran, Zhiwen Wang, Hui Yu, Yi Zhang

专题命中 医学数据与评测 :CT(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02226 2023-08-04 cs.CV physics.med-ph q-bio.TO 71%

Terabyte-scale supervised 3D training and benchmarking dataset of the mouse kidney

Willy Kuo, Diego Rossinelli, Georg Schulz, Roland H. Wenger, Simone Hieber, Bert Müller, Vartan Kurtcuoglu

专题命中 医学数据与评测 :medical image(abstract);biomedical(abstract);分类 cs.CV、q-bio

Journal ref Scientific Data 10, 510 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.07897 2020-10-16 q-bio.QM eess.IV 71%

Spatial Registration Evaluation of [18F]-MK6240 PET

James Zou, Aubrey Johnson, Jeanelle France, Srinidhi Bharadwaj, Zeljko Tomljanovic, Yaakov Stern, Adam M. Brickman, Devangere P. Devanand, Jose A. Luchsinger, William C. Kreisl, Frank A. Provenzano

专题命中 医学数据与评测 :MRI(abstract);CT(abstract);分类 q-bio、eess.IV

Comments 19 pages, 8 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06752 2018-11-19 physics.flu-dyn 71%

Modern discontinuous Galerkin methods for the simulation of transitional and turbulent flows in biomedical engineering: A comprehensive LES study of the FDA benchmark nozzle model

Niklas Fehn, Wolfgang A. Wall, Martin Kronbichler

专题命中 医学数据与评测 :biomedical(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08727 2026-08-11 cs.CV cs.AI 新提交 70%

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

专题命中 医学数据与评测 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26207 2026-07-30 cs.CV 新提交 70%

Where Physics Meets Privacy: Federated PINNs for Privacy-Preserving Brain Tumor Biomechanical Modeling

物理与隐私的结合:用于隐私保护的脑肿瘤生物力学建模的联邦物理信息神经网络

Mahmuda Akter Sristy, Md Al-Mahfuz Chowdhury, Momota Ahsana Meem, Sajid Ahamed, Kazi Irfan Subhan

机构 * United International University(联合国际大学)

专题命中 医学数据与评测 :MRI(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出联邦物理信息神经网络,结合联邦学习与线性弹性方程的物理约束,在保护数据隐私的前提下,实现了脑肿瘤生物力学建模,其性能优于汇集数据训练的基线模型。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 70%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 医学数据与评测 :MRI(abstract,abstract_cn);分类 cs.LG

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16300 2026-07-21 cs.CV 新提交 70%

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

FedDP-PALD:一种用于医学数据合成的具有原型聚合的隐私保护联邦潜在扩散框架

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

机构 * BRAC University(BRAC大学) York University(约克大学) University of Maryland(马里兰大学)

专题命中 医学数据与评测 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 针对医学数据合成中隐私保护及合成数据预测结构问题,提出FedDP-PALD框架,通过带掩码的门控多头注意力联合处理多模态数据,引入DP-PMA维持差分隐私,实验表明该框架能生成隐私合成表示,保持决策性能并抵抗成员推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24302 2026-06-24 cs.CV cs.DL 新提交 70%

TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation

TrOCR 用于中世纪手写文本识别:基于跨数据集验证的系统消融研究

Sachin Sharma, Michele Flammini, Federico Simonetta

机构 * GSSI – Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 医学数据与评测 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 研究通过对比度归一化、数据增强和层冻结三种可控微调策略,提升TrOCR在中世纪手稿上的识别精度,在13世纪意大利手稿上达到8.03%字符错误率,并验证了跨数据集的鲁棒性。

Comments Accepted at Document Analysis Systems Workshop 2026 (ICDAR Satellite event)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15436 2026-06-16 cs.LG cs.AI eess.AS 新提交 70%

Beyond Classification: A Cough Regression Benchmark for Respiratory Acoustic Foundation Models

超越分类:呼吸声学基础模型的咳嗽回归基准

Mayur Sanap, Prasanna Desikan, Edgar Lobaton

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 医学数据与评测 :CT(abstract,abstract_cn);分类 cs.LG

AI总结 提出多模型多目标咳嗽回归基准,评估五个基础模型在六个目标上的表现,发现MLP-small优于线性探测,揭示数据集大小与头部容量的权衡,并展示跨数据集迁移的不对称性。

Comments Accepted at the ICML 2026 Workshop on Structured Data for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11517 2026-06-10 cs.CL cs.LG 70%

PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation

PeruMedQA:在秘鲁医学考试上评估大语言模型(LLMs)——数据集构建与评估

Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

机构 * Hubert Department of Global Health, Rollins School of Public Health, Emory University(霍伯特全球健康部门,埃默里大学公共卫生学院) Emory Global Diabetes Research Center of Woodruff Health Sciences Center, Emory University(埃默里大学伍德鲁夫健康科学中心全球糖尿病研究中心) Institut de Recherche en Informatique de Toulouse(图卢兹信息研究院) Universidad Nacional de Educación a Distancia(远程教育国立大学) Instituto de Investigación Científica, Universidad de Lima(科学研究所,利马大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 医学数据与评测 :medical AI(abstract);radiology(abstract);分类 cs.LG

AI总结 本文构建了包含8380道题的秘鲁医学考试数据集,通过微调大语言模型并对比不同模型的准确率,揭示了在西班牙语国家医学问题上的性能差异。

Comments https://github.com/rodrigo-carrillo/PeruMedQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00794 2026-06-02 cond-mat.mtrl-sci cs.LG 70%

Benchmark Dataset for Catalysis on 2D MXenes

二维MXene催化基准数据集

Pavlo Melnyk, Anmar Karmush, Mårten Wadenbäck, Ania Beatriz Rodríguez-Barrera, Johanna Rosen, Michael Felsberg, Jonas Björk

机构 * Computer Vision and Learning Systems, Department of Electrical Engineering (ISY) & AI4X(计算机视觉与学习系统,电气工程系(ISY)及AI4X) Materials Design Division, Department of Physics, Chemistry and Biology (IFM)(材料设计分校,物理、化学与生物系(IFM)) Wallingenberg Initiative Materials Science for Sustainability (WISE)(瓦伦贝格可持续材料科学倡议(WISE))

专题命中 医学数据与评测 :CT(abstract,abstract_cn);分类 cs.LG

AI总结 通过结合第一性原理计算与机器学习,构建包含50000个DFT计算训练集和10000个测试集的数据集,训练并验证多种机器学习原子间势模型,实现约10^3倍加速且保持高精度,推动MXene催化行为的高效研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26003 2026-05-26 cs.CV 70%

Towards 3D heart mesh generation using contactless radar imaging and physics-informed neural network

基于非接触式雷达成像和物理信息神经网络的3D心脏网格生成

Jinye Li, Chenxi Fu, Minghang Zheng, Yang Liu, Xiahai Zhuang, Qingchao Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学) Peking University(北京大学)

专题命中 医学数据与评测 :MRI(abstract,abstract_cn);分类 cs.CV

AI总结 提出SAR2Mesh框架,通过粗到细的网格变形过程,结合几何感知特征投影和物理信息雷达损失,从合成孔径雷达图像重建高保真3D心脏几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00520 2026-05-21 cs.CV 70%

CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?

CardioBench: 心脏超声基础模型是否能超越实验室?

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 医学数据与评测 :pathology(abstract);biomedical(abstract);分类 cs.CV

AI总结 本文提出CardioBench,一个用于评估心脏超声基础模型的基准,通过统一多个公开数据集,评估不同模型在零样本、探测和对齐协议下的性能,揭示通用模型在功能任务上表现优异,但细粒度区分任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 70%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 医学数据与评测 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏