arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 966 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 966 篇

2510.12953 2026-08-05 cs.CV cs.AI cs.IR cs.MM 版本更新 70%

Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation

具备知识意识的视觉-语言基础模型用于胎儿超声解读

Xiao He, Huangxuan Zhao, Guojia Wan, Jiancheng Pan, Yanxing Liu, Yong Luo, Juhua Liu, Yongchao Xu, Wei Zhou, Dacheng Tao, Bo Du

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程技术研究中心,武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学)

专题命中 医疗多模态 :medical AI(abstract);diagnosis(abstract);分类 cs.CV

AI总结 FetalMind通过Salient Epistemic Disentanglement方法,提升胎儿超声解读的准确性和效率,实现多视图图像推理和疾病诊断的高效处理。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22144 2026-08-04 cs.CV cs.AI 版本更新 70%

SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis

SAGE:面向多模态学习与幻觉分析的专家标注南亚胃肠内镜数据集

Niyoj Oli, Sachin Acharya, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Mani Shrestha, Ram Bahadur Gurung, Yash Raj Shrestha, Prashnna K Gyawali, Binod Bhattarai

机构 * Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息技术研究所) GastroIntestinal Department, Dhulikhel Hospital(杜尔基hel医院消化内科) Univesity of Lausanne(洛桑大学) University of West Virginia(西弗吉尼亚大学) University of Utah(犹他大学) University of Aberdeen(阿伯丁大学)

专题命中 医疗多模态 :medical AI(abstract);diagnosis(abstract);分类 cs.CV

AI总结 为解决南亚地区胃肠癌诊断数据缺乏问题,构建了包含1300张图像、标注和问答对的SAGE数据集,并评估了模型在人口偏移下的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 70%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 医疗多模态 :pathology(abstract);biomedical(abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交 70%

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17412 2026-07-28 cs.CV cs.AI 版本更新 70%

Enhancing Pathological VLMs with Cross-scale Reasoning

增强病理视觉语言模型的跨尺度推理能力

Chi Phan, Tianyi Zhang, Qiaochu Xue, Yufeng Wu, Dan Hu, Zeyu Liu, Sudong Wang, Yueming Jin

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) PuzzleLogic Pte Ltd(PuzzleLogic私人有限公司) Department of Pathology, Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院病理科暨福建省肿瘤医院)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 提出首个跨尺度训练与评估范式,通过多倍率视觉问答任务增强病理视觉语言模型的跨尺度推理能力,并构建高质量基准数据集Scale-VQA及模型ScaleReasoner-R1,实现最优性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 70%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06379 2026-07-10 cs.CV cs.AI 版本更新 70%

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型

Qiwei Zeng, Hao Wang, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

机构 * Jilin University(吉林大学) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ByteDance(字节跳动) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)

专题命中 医疗多模态 :medical image(abstract);pathology(abstract);分类 cs.CV

AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交 70%

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04101 2026-07-03 cs.CV 版本更新 70%

NEARL: Interacted Query Adaptation with Orthogonal Regularization for Medical Vision-Language Understanding

NEARL: 基于正交正则化的交互式查询自适应用于医学视觉-语言理解

Zelin Peng, Yichen Zhao, Yu Huang, Piao Yang, Feilong Tang, Zhengqin Xu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence(人工智能MOE实验室) AI Institute(人工智能研究院) School of Computer Science(计算机科学学院) Shanghai Jiao Tong University(上海交通大学) Department of Radiology(放射科) The First Affiliated Hospital(第一附属医院) School of Medicine(医学院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State Key Laboratory of Infrared Physics(红外物理国家重点实验室) Shanghai Institute of Technical Physics(上海技术物理研究所) Chinese Academy of Science(中国科学院)

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 提出NEARL框架,通过统一协同嵌入变换器(USEformer)和正交交叉注意力适配器(OCA)实现双向跨模态交互,仅引入1.46M参数,在三个医学影像数据集上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08420 2026-06-26 cs.CV 新提交 70%

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs

CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模

Sergios Gatidis, Curtis Langlotz, Christian Bluethgen

机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) Department of Radiology, Stanford University(斯坦福大学放射学系)

专题命中 医疗多模态 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16573 2026-06-16 cs.CV 新提交 70%

Transformation-driven generation of comparable projection images from multimodal anatomical scenes

从多模态解剖场景生成可比较投影图像的变换驱动方法

Dariusz Pojda, Krzysztof Domino, Michał Tarnawski, Agnieszka Anna Tomaka

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所)

专题命中 医疗多模态 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 提出变换驱动框架,从多模态解剖数据生成可重复的投影空间观测,通过下颌运动场景验证,实现不同解剖配置下直接可比的虚拟X光投影生成。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05576 2026-06-05 cs.CV 70%

UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning

UltraVR:面向证据推理的诊断性超分辨率图像VQA基准

Gexin Huang, Yanting Yang, Myeongkyun Kang, Beidi Zhao, Jun Zhou, Chen Zhou, Gang Wang, Zu-hua Gao, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) BC Cancer Agency(不列颠哥伦比亚癌症中心) The Hong Kong Polytechnic University(香港理工大学)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 提出UltraVR基准,通过结构化思维链标注诊断视觉语言模型在超分辨率图像上的证据推理能力,发现模型在证据定位和局部感知环节错误集中。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 70%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15234 2026-06-02 cs.CV 70%

Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays

探索大语言模型编码器在胸部X光片图像-文本检索中的能力

Hanbin Ko, Gihun Cho, Inhyeok Baek, Donguk Kim, Joonbeom Koo, Changi Kim, Dongheon Lee, Chang Min Park

机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学科学整合专业,首尔国立大学研究生院) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第一附属医院放射科) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院放射科,首尔国立大学医院) Institute of Medical and Biological Engineering, Seoul National University Medical Research Center(医学与生物工程研究所,首尔国立大学医学研究所以及) Institute of Radiation Medicine, Seoul National University Medical Research Center(放射医学研究所,首尔国立大学医学研究所以及)

专题命中 医疗多模态 :medical image(abstract);radiology(abstract);分类 cs.CV

AI总结 提出一种领域自适应的双向大语言模型文本编码器,通过掩码标记预测和监督对比学习训练,结合参数高效的双塔对比视觉语言框架,提升胸部X光片图像与文本的对齐和检索性能。

Comments 12 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16414 2026-05-19 cs.LG cs.AI 70%

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

PyHealth 2.0: 一个全面的开源工具包,用于可访问和可重复的临床深度学习

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Joshua Steier, Andrea Fitzpatrick, Bilal Arif, Rian Atri, Jathurshan Pradeepkumar, Siddhartha Laghuvarapu, Junyi Gao, Adam R. Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校) PyHealth Research Initiative(PyHealth研究计划) University of Illinois College of Medicine, Chicago, IL, USA(伊利诺伊大学医学院) The University of Edinburgh, Edinburgh, UK(爱丁堡大学) Health Data Research UK, London, UK(英国健康数据研究) Department of Biomedical Engineering, Bangladesh University of Engineering(孟加拉国工程大学生物医学工程系)

专题命中 医疗多模态 :clinical AI(abstract);healthcare AI(abstract);分类 cs.LG

AI总结 本文提出PyHealth 2.0,一个全面的开源工具包,旨在解决临床AI研究中的可重复性和可访问性问题,通过统一15+数据集、20+临床任务、25+模型、5+可解释性方法和不确定性量化方法,实现7行代码即可完成预测建模。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15736 2026-05-18 cs.CV cs.AI 70%

BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation

BiomedAP: 一种基于视觉的双锚框架与门控跨模态融合用于鲁棒的医学视觉-语言适应

Huanyang Tong, Kai Liu, Fangjun Kuang, Huiling Chen

机构 * Wenzhou University(温州大学) Wenzhou Business College(温州商务学院)

专题命中 医疗多模态 :diagnosis(abstract);biomedical(abstract);分类 cs.CV

AI总结 BiomedAP通过门控跨模态融合和双锚约束机制,提升医学视觉-语言模型在提示变化下的鲁棒性,实验显示其在多个基准上均优于基线方法。

Comments CVPR2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09443 2026-05-12 cs.CV cs.CL 70%

Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent

通过角色视角:解决多模态角色扮演代理中的模态-角色干扰

Yihong Tang, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城院)

专题命中 医疗多模态 :MRI(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出CAVI框架,通过角色视角减少多模态角色扮演代理中的模态-角色干扰,提升角色一致的多模态交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 70%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 70%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 医疗多模态 :MRI(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 70%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 医疗多模态 :diagnosis(abstract);radiology(abstract);分类 cs.CV

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09067 2026-04-13 cs.CV cs.AI 70%

Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations

通过合成演示增强医疗视觉-语言模型的安全性

Zhiyu Xue, Reza Abbasi-Asl, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC San Francisco(加州大学旧金山分校)

专题命中 医疗多模态 :medical image(abstract);CT(abstract);分类 cs.CV

AI总结 本文提出一种新的推理时防御策略,通过合成临床演示提升模型安全性,同时平衡安全与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI 70%

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 医疗多模态 :CT(abstract);diagnosis(abstract);分类 cs.CV

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22509 2026-03-25 cs.CV 70%

Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

Sketch2CT:多模态扩散用于结构感知的3D医学体积生成

Delin An, Chaoli Wang

机构 * University of Notre Dame(诺特大学)

专题命中 医疗多模态 :medical image(abstract);CT(abstract);分类 cs.CV

AI总结 Sketch2CT通过结合用户提供的2D草图和文本描述,利用多模态扩散框架生成结构一致的3D医学体积,提升生成质量与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04878 2026-03-06 cs.CV 70%

Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation

基于结构观测的图像-文本对比学习用于CT报告生成

Hong Liu, Dong Wei, Qiong Peng, Yawen Huang, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医学数据科学研究院) Jarvis Research Center, Tencent YouTu Lab, Shenzhen, China(腾讯YouTu实验室 Jarvis研究部) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室)

专题命中 医疗多模态 :CT(abstract);radiology(abstract);分类 cs.CV

AI总结 本文提出基于结构观测的图像-文本对比学习框架,用于提升CT报告生成的临床效率和准确性。

Comments Accept to IPMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00479 2026-03-03 cs.CV 70%

U-VLM: Hierarchical Vision Language Modeling for Report Generation

U-VLM:用于报告生成的分层视觉语言模型

Pengcheng Shi, Minghui Zhang, Kehan Song, Jiaqi Liu, Yun Gu, Xinglin Zhang

机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 医疗多模态 :CT(abstract);radiology(abstract);分类 cs.CV

AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22143 2026-02-26 cs.CV 70%

MedTri: A Platform for Structured Medical Report Normalization to Enhance Vision-Language Pretraining

MedTri:一种用于结构化医学报告标准化以增强视觉-语言预训练的平台

Yuetan Chu, Xinhua Ma, Xinran Jin, Gongning Luo, Xin Gao

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王科技大学) Faculty of Computing, Harbin, China(哈尔滨计算学院)

专题命中 医疗多模态 :CT(abstract);diagnosis(abstract);分类 cs.CV

AI总结 MedTri通过结构化医学报告标准化提升视觉-语言预训练效果,提供统一三元组格式并支持模块化增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02467 2026-02-16 cs.CV cs.AI 70%

Timing Is Everything: Finding the Optimal Fusion Points in Multimodal Medical Imaging

时机至关重要:在多模态医学影像中寻找最佳融合点

Valerio Guarrasi, Klara Mogensen, Sara Tassinari, Sara Qvarlander, Paolo Soda

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入系,生物医学工程与放射物理,乌梅大学)

专题命中 医疗多模态 :medical AI(abstract);MRI(abstract);分类 cs.CV

AI总结 本文提出一种顺序前进搜索算法,用于高效确定多模态医学影像中最佳融合时机,提升诊断准确性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21673 2026-01-30 cs.CV 70%

Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification

多模态视觉代理压缩用于阿尔茨海默病分类

Dexuan Ding, Ciyuan Peng, Endrowednes Kuantama, Jingcai Guo, Jia Wu, Jian Yang, Amin Beheshti, Ming-Hsuan Yang, Yuankai Qi

机构 * Macquarie University(麦考瑞大学) Federation University Australia(联邦大学澳大利亚) The Hong Kong Polytechnic University(香港理工大学) University of California at Merced(加州大学默塞德分校)

专题命中 医疗多模态 :MRI(abstract);diagnosis(abstract);分类 cs.CV

AI总结 MVSC通过压缩和适应大尺寸3D sMRI体积为紧凑的2D视觉代理,提升阿尔茨海默病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09879 2026-01-16 cs.CV cs.AI 70%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 医疗多模态 :CT(abstract);radiology(abstract);分类 cs.CV

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 70%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏