arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 966 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 966 篇

2502.05091 2025-04-28 cs.CV 77%

DCFormer: Efficient 3D Vision-Language Modeling with Decomposed Convolutions

Gorkem Can Ates, Yu Xin, Kuang Gong, Wei Shao

机构 * Department of Medicine, University of Florida(医学系,佛罗里达大学) Department of Electrical and Computer Engineering, University of Florida(电气与计算机工程系,佛罗里达大学) Department of Biomedical Engineering, University of Florida(生物医学工程系,佛罗里达大学) Intelligent Clinical Care Center, University of Florida(智能临床护理中心,佛罗里达大学)

专题命中 医疗多模态 :medical image(abstract);CT(abstract);radiology(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01886 2025-04-03 cs.CV 77%

GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning

Yanzhou Su, Tianbin Li, Jiyao Liu, Chenglong Ma, Junzhi Ning, Cheng Tang, Sibo Ju, Jin Ye, Pengcheng Chen, Ming Hu, Shixiang Tang, Lihao Liu, Bin Fu, Wenqi Shao, Xiaowei Hu, Xiangwen Liao, Yuanfeng Ji, Junjun He

专题命中 医疗多模态 :medical AI(abstract);medical image(abstract);diagnosis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15892 2025-03-21 cs.CV 77%

UMIT: Unifying Medical Imaging Tasks via Vision-Language Models

Haiyang Yu, Siyang Yi, Ke Niu, Minghan Zhuo, Bin Li

专题命中 医疗多模态 :medical image(abstract);CT(abstract);biomedical(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01248 2024-12-03 cs.CV 77%

Multimodal Fusion Learning with Dual Attention for Medical Imaging

Joy Dhar, Nayyar Zaidi, Maryam Haghighat, Puneet Goyal, Sudipta Roy, Azadeh Alavi, Vikas Kumar

专题命中 医疗多模态 :MRI(abstract);CT(abstract);diagnosis(abstract);分类 cs.CV

Comments 10 pages

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02608 2024-09-05 cs.CV 77%

A Medical Multimodal Large Language Model for Pediatric Pneumonia

Weiwei Tian, Xinyu Huang, Tianhao Cheng, Wen He, Jinwu Fang, Rui Feng, Daoying Geng, Xiaobo Zhang

专题命中 医疗多模态 :CT(abstract);diagnosis(abstract);radiology(abstract);分类 cs.CV

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06471 2024-07-29 cs.LG 77%

Multimodal Data Integration for Oncology in the Era of Deep Neural Networks: A Review

Asim Waqas, Aakash Tripathi, Ravi P. Ramachandran, Paul Stewart, Ghulam Rasool

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);radiology(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19061 2023-10-31 cs.CV 77%

Multimodal ChatGPT for Medical Applications: an Experimental Study of GPT-4V

Zhiling Yan, Kai Zhang, Rong Zhou, Lifang He, Xiang Li, Lichao Sun

专题命中 医疗多模态 :CT(abstract);pathology(abstract);radiology(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13319 2025-04-22 cs.CV cs.LG eess.IV 76%

HyperFusion: A Hypernetwork Approach to Multimodal Integration of Tabular and Medical Imaging Data for Predictive Modeling

Daniel Duenias, Brennan Nichyporuk, Tal Arbel, Tammy Riklin Raviv

机构 * Ben Gurion University of the Negev(本· Gurion 大学) Centre for Intelligent Machines, McGill University(智能机器中心,麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 医疗多模态 :MRI(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV;medical image(journal_ref)

Comments 20 pages, 11 figures

Journal ref Medical Image Analysis, Volume 102, May 2025, 103503

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04922 2026-06-04 cs.CV cs.AI cs.LG 76%

Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

几何感知蒸馏用于提示调优生物医学视觉-语言模型

Tran Dinh Tien, Zhiqiang Shen

机构 * Department of Machine Learning(机器学习系) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 医疗多模态 :biomedical(title);分类 cs.CV、cs.LG

AI总结 提出Omni-Geometry知识蒸馏(OGKD)框架,通过注入类别关系结构到教师模型,生成保留真实标签同时尊重类间几何的方向性目标,并设计全局几何感知蒸馏(GAD)和标签引导几何蒸馏(LGD)损失,在11个医学数据集上平均提升准确率1.7%-2.8%。

Comments Preprint. Code is available at https://github.com/tientrandinh/OGKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18400 2025-10-22 eess.IV cs.AI cs.CV 76%

A Multimodal Deep Learning Approach for White Matter Shape Prediction in Diffusion MRI Tractography

Yui Lo, Yuqian Chen, Dongnan Liu, Leo Zekelman, Jarrett Rushmore, Yogesh Rathi, Nikos Makris, Alexandra J. Golby, Fan Zhang, Weidong Cai, Lauren J. O'Donnell

专题命中 医疗多模态 :MRI(title);分类 cs.CV、eess.IV

Comments Paper accepted to Human Brain Mapping. 25 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09271 2025-08-14 eess.IV cs.LG 76%

A Generative Imputation Method for Multimodal Alzheimer's Disease Diagnosis

Reihaneh Hassanzadeh, Anees Abrol, Hamid Reza Hassanzadeh, Vince D. Calhoun

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA, USA(电气与计算机工程学院,佐治亚理工学院,亚特兰大,GA,USA) Courtesy Faculty Appointment, College of Pharmacy, University of Florida, Gainesville, FL, USA(佛罗里达大学药学院荣誉教职)

专题命中 医疗多模态 :diagnosis(title);分类 cs.LG、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09222 2025-07-22 cs.CV cs.LG 76%

Calibrated and Robust Foundation Models for Vision-Language and Medical Image Tasks Under Distribution Shift

Behraj Khan, Tahir Qasim Syed, Nouman M. Durrani, Bilal Naseem, Shabir Ahmad, Rizwan Qureshi

机构 * Institute of Business Administration Karachi(Karachi商业管理学院) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) CAIMI Pvt Ltd(CAIMI私营有限公司) Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,佛罗里达大学)

专题命中 医疗多模态 :medical image(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01911 2024-01-05 cs.CV cs.LG 76%

Backdoor Attack on Unpaired Medical Image-Text Foundation Models: A Pilot Study on MedCLIP

Ruinan Jin, Chun-Yin Huang, Chenyu You, Xiaoxiao Li

专题命中 医疗多模态 :medical image(title);分类 cs.CV、cs.LG

Comments Paper Accepted at the 2nd IEEE Conference on Secure and Trustworthy Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10331 2023-11-20 eess.IV cs.CV 76%

Leveraging Multimodal Fusion for Enhanced Diagnosis of Multiple Retinal Diseases in Ultra-wide OCTA

Hao Wei, Peilun Shi, Guitao Bai, Minqing Zhang, Shuangle Li, Wu Yuan

专题命中 医疗多模态 :diagnosis(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16222 2023-05-26 eess.IV cs.CV cs.LG q-bio.NC 76%

Incomplete Multimodal Learning for Complex Brain Disorders Prediction

Reza Shirkavand, Liang Zhan, Heng Huang, Li Shen, Paul M. Thompson

专题命中 医疗多模态 :diagnosis(abstract);biomedical(abstract);分类 cs.CV、cs.LG、q-bio

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.09454 2020-06-18 q-bio.NC cs.CV cs.LG eess.IV 76%

Interpretable multimodal fusion networks reveal mechanisms of brain cognition

Wenxing Hu, Xianghe Meng, Yuntong Bai, Aiying Zhang, Biao Cai, Gemeng Zhang, Tony W. Wilson, Julia M. Stephen, Vince D. Calhoun, Yu-Ping Wang

专题命中 医疗多模态 :diagnosis(abstract);biomedical(abstract);分类 cs.CV、cs.LG、q-bio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 75%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 医疗多模态 :medical AI(abstract);clinical AI(abstract);diagnosis(abstract)

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02885 2026-06-19 cs.CL 版本更新 75%

Med-R2: Perception and Reflection-driven Complex Reasoning for Medical Report Generation

Med-R2:面向医学报告生成的感知与反思驱动复杂推理

Hao Wang, Shuchang Ye, Jinghao Lin, Usman Naseem, Jinman Kim

机构 * The School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) The School of Computing, Macquarie University(麦考瑞大学计算机学院) Doubao Medical Group, ByteDance(字节跳动 doubao 医疗集团)

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);radiology(abstract)

AI总结 提出Med-R2微调策略,通过引入感知驱动的长推理过程和放射学知识指导,并加入反思机制修正感知错误,提升LVLMs在医学报告生成中的病理特征感知和诊断准确性。

Comments 28 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12953 2026-06-12 cs.AI cs.CV cs.LG eess.IV 新提交 75%

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

OpenMedQ:面向医学视觉语言模型的广泛开放预训练

Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学)

专题命中 医疗多模态 :pathology(abstract);radiology(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 提出OpenMedQ,在14个数据集(约335万样本)上预训练医学视觉语言模型,在PathVQA上BLEU-1达75.9,超越562B参数的Med-PaLM M,并在8个未见医学分类任务上取得最高平均macro-F1(0.757)。

Comments Medical Imaging with Deep Learning (MIDL) 2026, Short Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10410 2026-04-17 cs.AI 75%

CWCD: Category-Wise Contrastive Decoding for Structured Medical Report Generation

CWCD:用于结构化医学报告生成的类别级对比解码

Shantam Srivastava, Mahesh Bhosale, David Doermann, Mingchen Gao

机构 * The Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, The State University of New York, NY, USA(布法罗大学,纽约州立大学)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);radiology(abstract)

AI总结 本文提出CWCD框架,通过类别特定参数化和对比正常与遮蔽X光片生成结构化放射报告,提升临床效果和生成质量。

Comments Accepted to MIDL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00907 2026-01-06 eess.IV cs.AI cs.CV cs.LG 75%

Placenta Accreta Spectrum Detection using Multimodal Deep Learning

利用多模态深度学习进行胎盘增生谱检测

Sumaiya Ali, Areej Alhothali, Sameera Albasri, Ohoud Alzamzami, Ahmed Abduljabbar, Muhammad Alwazzan

机构 * Department of Computer Science, Faculty of Computing and Information Technology, King Abdulaziz University(计算机科学系,计算与信息科技学院,国王阿卜杜勒阿齐兹大学) Department of Radiology, King Abdulaziz University Hospital(放射科,国王阿卜杜勒阿齐兹大学医院)

专题命中 医疗多模态 :MRI(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 本研究提出多模态深度学习方法,通过整合3D MRI和2D US数据,提高胎盘增生谱检测的准确率和AUC值,有效提升产前风险评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02328 2025-10-06 cs.CL cs.AI cs.MA 75%

AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering

Ziqing Wang, Chengsheng Mao, Xiaole Wen, Yuan Luo, Kaize Ding

机构 * Northwestern University(西北大学) Microsoft(微软公司)

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);biomedical(abstract)

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14536 2025-03-31 eess.IV cs.AI cs.CV cs.LG 75%

Advancing Chronic Tuberculosis Diagnostics Using Vision-Language Models: A Multi modal Framework for Precision Analysis

Praveen Shastry, Sowmya Chowdary Muthulur, Naveen Kumarasami, Anandakumar D, Mounigasri M, Keerthana R, Kishore Prasath Venkatesh, Bargava Subramanian, Kalyan Sivasailam, Revathi Ezhumalai, Abitha Marimuthu

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

Comments 10 pages , 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20662 2025-03-27 cs.CV cs.LG eess.IV 75%

AutoRad-Lung: A Radiomic-Guided Prompting Autoregressive Vision-Language Model for Lung Nodule Malignancy Prediction

Sadaf Khademi, Mehran Shabanpour, Reza Taleei, Anastasia Oikonomou, Arash Mohammadi

专题命中 医疗多模态 :CT(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02836 2023-07-03 eess.IV cs.CV cs.LG 75%

Longitudinal Multimodal Transformer Integrating Imaging and Latent Clinical Signatures From Routine EHRs for Pulmonary Nodule Classification

Thomas Z. Li, John M. Still, Kaiwen Xu, Ho Hin Lee, Leon Y. Cai, Aravind R. Krishnan, Riqiang Gao, Mirza S. Khan, Sanja Antic, Michael Kammer, Kim L. Sandler, Fabien Maldonado, Bennett A. Landman, Thomas A. Lasko

专题命中 医疗多模态 :CT(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

Comments Accepted to MICCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.07646 2021-11-16 cs.CV cs.LG eess.IV 75%

Multimodal Generalized Zero Shot Learning for Gleason Grading using Self-Supervised Learning

Dwarikanath Mahapatra

专题命中 医疗多模态 :MRI(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20872 2025-07-29 cs.CV cs.AI cs.LG 74%

Not Only Grey Matter: OmniBrain for Robust Multimodal Classification of Alzheimer's Disease

Ahmed Sharshar, Yasser Ashraf, Tameem Bakr, Salma Hassan, Hosam Elgendy, Mohammad Yaqub, Mohsen Guizani

专题命中 医疗多模态 :diagnosis(abstract,comments);MRI(abstract);分类 cs.CV、cs.LG

Comments Published in Third Workshop on Computer Vision for Automated Medical Diagnosis CVAMD 2025 in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.09321 2020-04-21 cs.CV eess.IV 74%

Combining multimodal information for Metal Artefact Reduction: An unsupervised deep learning framework

Marta B. M. Ranzini, Irme Groothuis, Kerstin Kläser, M. Jorge Cardoso, Johann Henckel, Sébastien Ourselin, Alister Hart, Marc Modat

专题命中 医疗多模态 :MRI(abstract);CT(abstract);分类 cs.CV、eess.IV;biomedical(comments)

Comments Accepted at IEEE International Symposium on Biomedical Imaging (ISBI) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12677 2026-08-14 cs.AI cs.CV 新提交 74%

The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis

自然语言理解在基于多模态视频的登革热诊断中的作用

Danial Sharifrazi, Saadat Behzadi, Julakha Jahan Jui, Mojtaba Mohammadi, Nouman Javed, Roohallah Alizadehsani, Prasad N. Paradkar, Asim Bhatti

专题命中 医疗多模态 :diagnosis(title);分类 cs.CV

AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 74%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 医疗多模态 :radiology(title);分类 cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏