arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 966 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 966 篇

2606.02809 2026-06-03 cs.CV 81%

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

自动化报告驱动的肿瘤学VQA基准:用于评估3D医学影像上的视觉-语言模型

Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin

机构 * UCSF–UC Berkeley Joint Graduate Program in Bioengineering(UCSF-伯克利生物工程联合研究生项目) Department of Radiology, UCSF(UCSF放射科) Department of Radiation Oncology, UCSF(UCSF放射肿瘤科)

专题命中 医疗多模态 :CT(abstract,abstract_cn);medical image(abstract);radiology(abstract);分类 cs.CV

AI总结 提出一个自动化管道,从私有放射学报告和3D肿瘤影像生成多选VQA数据集,构建无污染基准,评估六种视觉-语言模型,发现视觉依赖因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05867 2026-03-10 cs.CV 81%

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析

Sijing Li, Zhongwei Qiu, Jiang Liu, Wenqiao Zhang, Tianwei Lin, Yihan Xie, Jianxiang An, Boxiang Yun, Chenglin Yang, Jun Xiao, Guangyu Guo, Jiawen Yao, Wei Liu, Yuan Gao, Ke Yan, Weiwei Cao, Zhilin Zheng, Tony C. W. Mok, Kai Cao, Yu Shi, Jiuyu Zhang, Jian Zhou, Beng Chin Ooi, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) Shengjing Hospital of China Medical University(中国医科大学盛京医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心)

专题命中 医疗多模态 :CT(abstract);pathology(abstract);diagnosis(abstract);radiology(abstract)

AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。

Comments Accepted at ICLR 2026. 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 81%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 医疗多模态 :medical image(abstract);CT(abstract);diagnosis(abstract);radiology(abstract)

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17834 2026-02-10 cs.CV 81%

Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography

从多模态数据集构建通用基础模型用于三维计算机断层扫描

Ibrahim Ethem Hamamci, Sezgin Er, Chenyu Wang, Furkan Almas, Ayse Gulnihan Simsek, Sevval Nil Esirgun, Irem Dogan, Omer Faruk Durugol, Benjamin Hou, Suprosanna Shit, Weicheng Dai, Murong Xu, Hadrien Reynaud, Muhammed Furkan Dasdelen, Bastian Wittmann, Tamaz Amiranashvili, Enis Simsar, Mehmet Simsar, Emine Bensu Erdemir, Abdullah Alanbay, Anjany Sekuboyina, Berkan Lafci, Ahmet Kaplan, Zhiyong Lu, Malgorzata Polacin, Bernhard Kainz, Christian Bluethgen, Kayhan Batmanghelich, Mehmet Kemal Ozdemir, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Division of Intramural Research, National Institutes of Health(美国国立卫生研究院内部研究部) Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Institute for Diagnostic and Interventional Radiology, University Hospital Zurich(苏黎世大学医院诊断与介入放射学研究所) Department Artificial Intelligence in Biomedical Engineering, FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡工业大学生物医学工程人工智能系)

专题命中 医疗多模态 :medical AI(abstract);medical image(abstract);CT(abstract);radiology(abstract)

AI总结 本文提出CT-RATE数据集及CT-CLIP和CT-CHAT模型,用于三维医学影像的通用基础模型研究,提升了多异常检测和病例检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10372 2024-12-16 cs.CV 81%

UniMed-CLIP: Towards a Unified Image-Text Pretraining Paradigm for Diverse Medical Imaging Modalities

Muhammad Uzair Khattak, Shahina Kunhimon, Muzammal Naseer, Salman Khan, Fahad Shahbaz Khan

专题命中 医疗多模态 :medical image(abstract);MRI(abstract);CT(abstract);pathology(abstract)

Comments Code, models and demo available at https://github.com/mbzuai-oryx/UniMed-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 81%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV、cs.LG

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03477 2026-03-11 cs.CV cs.LG 81%

Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis

面向医疗青光眼诊断的公平性感知视觉语言模型微调

Zijian Gu, Yuxi Liu, Zhenhao Zhang, Song Wang

机构 * Department of Computer Science, University of Rochester, NY, USA(罗切斯特大学计算机科学系) Biostatistics and Health Data Science, School of Medicine, Indiana University, Indianapolis, IN, USA(印第安纳大学医学院生物统计学与健康数据科学系) Department of Computer Science, University of Central Florida, FL, USA(佛罗里达州立大学计算机科学系)

专题命中 医疗多模态 :diagnosis(title);medical AI(abstract);分类 cs.CV、cs.LG

AI总结 本文提出公平性感知的低秩适应方法,通过三种机制减少医疗影像诊断中的种族差异,实现高效公平的青光眼诊断。

Comments AMIA 2026 Amplify Informatics Conference (Poster), Denver, CO, May 18-21, 2026. 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04062 2025-11-13 eess.IV cs.CV 81%

PET2Rep: Towards Vision-Language Model-Drived Automated Radiology Report Generation for Positron Emission Tomography

Yichi Zhang, Wenbo Zhang, Zehui Ling, Gang Feng, Sisi Peng, Deshu Chen, Yuchen Liu, Hongwei Zhang, Shuqi Wang, Lanlan Li, Limei Han, Yuan Cheng, Zixin Hu, Yuan Qi, Le Xue

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV、eess.IV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2025-08-19 cs.CV cs.LG 81%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 医疗多模态 :diagnosis(title);radiology(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07525 2025-07-23 cs.CV cs.AI cs.LG 81%

RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment

Difei Gu, Yunhe Gao, Yang Zhou, Mu Zhou, Dimitris Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学)

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV、cs.LG

Comments Accepted to MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18378 2025-06-24 eess.IV cs.CV 81%

Taming Vision-Language Models for Medical Image Analysis: A Comprehensive Review

Haoneng Lin, Cheng Xu, Jing Qin

机构 * Center of Smart Health, Hong Kong Polytechnic University, Hong Kong, China(智能健康中心,香港理工大学,中国)

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV、eess.IV

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17042 2025-05-26 cs.CL cs.CV cs.IR cs.LG 81%

VLM-KG: Multimodal Radiology Knowledge Graph Generation

Abdullah Abdullah, Seong Tae Kim

机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆熙大学)

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05575 2025-04-09 cs.CV cs.LG 81%

A Lightweight Large Vision-language Model for Multimodal Medical Images

Belal Alsinglawi, Chris McCarthy, Sara Webb, Christopher Fluke, Navid Toosy Saidy

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV、cs.LG

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10536 2025-02-18 cs.CV cs.AI cs.LG 81%

PolyPath: Adapting a Large Multimodal Model for Multi-slide Pathology Report Generation

Faruk Ahmed, Lin Yang, Tiam Jaroensri, Andrew Sellergren, Yossi Matias, Avinatan Hassidim, Greg S. Corrado, Dale R. Webster, Shravya Shetty, Shruthi Prabhakara, Yun Liu, Daniel Golden, Ellery Wulczyn, David F. Steiner

专题命中 医疗多模态 :pathology(title,abstract);分类 cs.CV、cs.LG

Comments 8 main pages, 21 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05536 2024-12-10 eess.IV cs.AI cs.CL cs.CV 81%

Comprehensive Evaluation of Multimodal AI Models in Medical Imaging Diagnosis: From Data Augmentation to Preference-Based Comparison

Cailian Ruan, Chengyue Huang, Yahe Yang

专题命中 医疗多模态 :diagnosis(title);medical image(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08588 2024-10-14 eess.IV cs.AI cs.CV 81%

ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation

Siyou Li, Beining Xu, Yihao Luo, Dong Nie, Le Zhang

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06496 2024-06-18 cs.LG cs.CL cs.CV 81%

Direct Preference Optimization for Suppressing Hallucinated Prior Exams in Radiology Report Generation

Oishi Banerjee, Hong-Yu Zhou, Subathra Adithan, Stephen Kwak, Kay Wu, Pranav Rajpurkar

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV、cs.LG

Comments Added acknowledgemnts

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06024 2024-03-12 cs.CV cs.ET cs.LG 81%

Semi-Supervised Multimodal Multi-Instance Learning for Aortic Stenosis Diagnosis

Zhe Huang, Xiaowei Yu, Benjamin S. Wessler, Michael C. Hughes

专题命中 医疗多模态 :diagnosis(title,abstract);分类 cs.CV、cs.LG

Comments Echocardiography; Multimodal; Semi-supervised Learning; Multiple-Instance Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06580 2023-03-14 cs.CV cs.CL cs.LG 81%

Towards General Purpose Medical AI: Continual Learning Medical Foundation Model

Huahui Yi, Ziyuan Qin, Qicheng Lao, Wei Xu, Zekun Jiang, Dequan Wang, Shaoting Zhang, Kang Li

专题命中 医疗多模态 :medical AI(title,abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21998 2026-07-27 cs.CV 新提交 80%

Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models

医学检查表:评估多模态模型对医学图像的理解

Bannapol Limanond, Masanori Suganuma, Takayuki Okatani

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV;biomedical(comments)

AI总结 介绍医学检查表这一基准测试,通过给模型一张图像及一正一误两个标题进行二元测试,可统一评估不同多模态模型,验证其对医学概念的理解,评估其处理分布外输入的能力,用其评估四个先进模型发现它们理解图像能力待提升。

Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10842 2024-07-04 cs.CV 80%

Automated Radiology Report Generation: A Review of Recent Advances

Phillip Sloan, Philip Clatworthy, Edwin Simpson, Majid Mirmehdi

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV;biomedical(comments)

Comments 24 pages, 8 figures, 6 tables. Accepted by IEEE Reviews in Biomedical Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08600 2026-04-13 q-bio.TO eess.IV 80%

Gaze2Report: Radiology Report Generation via Visual-Gaze Prompt Tuning of LLMs

Gaze2Report:通过视觉-凝视提示调优LLM实现放射学报告生成

Aishik Konwer, Moinak Bhattacharya, Prateek Prasanna

专题命中 医疗多模态 :radiology(title,abstract);分类 q-bio、eess.IV

AI总结 本文提出Gaze2Report框架,利用扫描路径预测模块和图神经网络生成视觉-凝视标记,结合指令和报告标记对LLM进行微调,提升报告生成质量并实现推理时无需凝视输入。

Comments Accepted at ISBI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL 80%

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

专题命中 医疗多模态 :clinical AI(abstract);pathology(abstract);radiology(abstract);biomedical(abstract)

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03742 2025-08-07 eess.IV cs.AI cs.CV cs.LG 80%

Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training

Weiwei Cao, Jianpeng Zhang, Zhongyi Shui, Sinuo Wang, Zeli Chen, Xi Li, Le Lu, Xianghua Ye, Tingbo Liang, Qi Zhang, Ling Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) The First Affiliated Hospital of College of Medicine, Zhejiang University(浙江大学医学院附属第一医院) Hupan Lab(虎盘实验室)

专题命中 医疗多模态 :medical image(abstract);CT(abstract);diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06518 2025-03-18 cs.LG q-bio.QM stat.ME 80%

Causal Representation Learning from Multimodal Biomedical Observations

Yuewen Sun, Lingjing Kong, Guangyi Chen, Loka Li, Gongxu Luo, Zijian Li, Yixuan Zhang, Yujia Zheng, Mengyue Yang, Petar Stojanov, Eran Segal, Eric P. Xing, Kun Zhang

专题命中 医疗多模态 :biomedical(title,abstract);分类 cs.LG、q-bio

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01529 2025-02-26 cs.CV cs.CL cs.LG eess.IV 80%

T3D: Advancing 3D Medical Vision-Language Pre-training by Learning Multi-View Visual Consistency

Che Liu, Cheng Ouyang, Yinda Chen, Cesar César Quilodrán-Casas, Lei Ma, Jie Fu, Yike Guo, Anand Shah, Wenjia Bai, Rossella Arcucci

专题命中 医疗多模态 :medical image(abstract);CT(abstract);radiology(abstract);分类 cs.CV、cs.LG、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13577 2020-04-29 cs.CV cs.AI cs.LG eess.IV 80%

Unifying Neural Learning and Symbolic Reasoning for Spinal Medical Report Generation

Zhongyi Han, Benzheng Wei, Yilong Yin, Shuo Li

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);radiology(abstract);分类 cs.CV、cs.LG、eess.IV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10505 2026-08-12 cs.AI cs.CL cs.CV 新提交 79%

RadFusion: Towards Threshold-Controllable Radiology Report Generation

RadFusion:迈向阈值可控的放射学报告生成

Ying Jin, Noel C. F. Codella, John Corring, Mu Wei, Dinei Florencio, Eric Horvitz

机构 * Microsoft(微软公司)

专题命中 医疗多模态 :radiology(title,abstract);分类 cs.CV

AI总结 RadFusion框架为放射学报告生成赋予阈值可控性,融合多标签分类器与VQA报告生成器,提升诊断准确率,支持ROC分析,适配不同临床场景,更易通过监管审批。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03322 2026-08-05 cs.CV 新提交 79%

LocAnyMed: Vision-Language Grounding for Multimodal Medical Images

LocAnyMed:面向多模态医学图像的视觉-语言定位

Zihan Wang, Tong Liu, Zhiwei Wang, Tao Huang, Wentao Jiang, Sihan Ma, Shanshan Ye, Xiaohui Yang, Jing Zhang

专题命中 医疗多模态 :medical image(title,abstract);分类 cs.CV

AI总结 该研究构建多模态医学视觉定位数据集LocAnyMed-200K及理由增强子集LocAnyMed-CoT-20K,通过微调LocateAnything-3B提升医学定位性能,为相关研究提供统一基础。

Comments Technical report; work in progress. 28 pages, 5 figures, and 16 tables. Code: https://github.com/MiliLab/LocAnyMed

详情

展开后加载摘要…

URL PDF HTML 收藏