arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 966 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 966 篇

2101.05434 2021-06-08 eess.IV cs.CV 66%

A Unified Conditional Disentanglement Framework for Multimodal Brain MR Image Translation

Xiaofeng Liu, Fangxu Xing, Georges El Fakhri, Jonghye Woo

专题命中 医疗多模态 :MRI(abstract);分类 cs.CV、eess.IV;biomedical(comments)

Comments Published in IEEE International Symposium on Biomedical Imaging (ISBI) 2021 for Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.01707 2020-01-07 cs.LG eess.IV stat.ML 66%

Meta-modal Information Flow: A Method for Capturing Multimodal Modular Disconnectivity in Schizophrenia

Haleh Falakshahi, Victor M. Vergara, Jingyu Liu, Daniel H. Mathalon, Judith M. Ford, James Voyvodic, Bryon A. Mueller, Aysenil Belger, Sarah McEwen, Steven G. Potkin, Adrian Preda, Hooman Rokham, Jing Sui, Jessica A. Turner, Sergey Plis, Vince D. Calhoun

专题命中 医疗多模态 :MRI(abstract);分类 cs.LG、eess.IV;biomedical(journal_ref)

Journal ref IEEE Transactions on Biomedical Engineering, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07878 2025-10-21 cs.LG cs.AI eess.SP q-bio.NC 65%

Comparative Analysis of Deep Learning Approaches for Harmful Brain Activity Detection Using EEG

Shivraj Singh Bhatti, Aryan Yadav, Mitali Monga, Neeraj Kumar

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Thapar Institute of Engineering and Technology(泰帕尔工程与技术学院)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG、q-bio、eess.SP

Comments 6 pages, 5 figures. Presented at IEEE CICT 2024. The paper discusses the application of multimodal data and training strategies in EEG-based brain activity classification

Journal ref 2024 IEEE 8th Int. Conf. on Info. and Comm. Tech. (CICT), pp. 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10659 2024-12-17 cs.CV cs.LG q-bio.QM 65%

MEATRD: Multimodal Anomalous Tissue Region Detection Enhanced with Spatial Transcriptomics

Kaichen Xu, Qilong Wu, Yan Lu, Yinan Zheng, Wenlin Li, Xingjie Tang, Jun Wang, Xiaobo Sun

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG、q-bio

Comments AAAI 2025. Code: https://github.com/wqlzuel/MEATRD

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06720 2024-08-26 cs.CV cs.LG q-bio.QM 65%

Multimodal Analysis of White Blood Cell Differentiation in Acute Myeloid Leukemia Patients using a β-Variational Autoencoder

Gizem Mert, Ario Sadafi, Raheleh Salehi, Nassir Navab, Carsten Marr

专题命中 医疗多模态 :biomedical(abstract);分类 cs.CV、cs.LG、q-bio

Comments Accepted for publication at MICCAI 2024 workshop on AI for Imaging Genomics Learning (AIIG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.02876 2022-09-08 cs.LG eess.IV q-bio.NC 65%

Self-supervised multimodal neuroimaging yields predictive representations for a spectrum of Alzheimer's phenotypes

Alex Fedorov, Eloy Geenjaar, Lei Wu, Tristan Sylvain, Thomas P. DeRamus, Margaux Luck, Maria Misiura, R Devon Hjelm, Sergey M. Plis, Vince D. Calhoun

专题命中 医疗多模态 :MRI(abstract);分类 cs.LG、q-bio、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05707 2022-04-25 cs.LG cs.AI eess.IV q-bio.GN 65%

Machine Learning Based Multimodal Neuroimaging Genomics Dementia Score for Predicting Future Conversion to Alzheimer's Disease

Ghazal Mirabnahrazam, Da Ma, Sieun Lee, Karteek Popuri, Hyunwoo Lee, Jiguo Cao, Lei Wang, James E Galvin, Mirza Faisal Beg, the Alzheimer's Disease Neuroimaging Initiative

专题命中 医疗多模态 :MRI(abstract);分类 cs.LG、q-bio、eess.IV

Journal ref J Alzheimers Dis 1 Jan. (2022) 1-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 62%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG、eess.SP

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20956 2026-07-21 cs.CV cs.AI cs.LG 版本更新 62%

BUSTR: Descriptor-Aware Vision-Language Learning for Breast Ultrasound Report Generation

BUSTR:用于乳腺超声报告生成的描述符感知视觉语言学习

Rawa Mohammed, Mina Attin, Laxmi Gewali, Bryar Shareef

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV、cs.LG

AI总结 针对公共BUS数据集缺乏配对报告限制模型发展的问题,提出BUSTR框架,利用结构化病变信息,通过构建描述符派生报告、训练多头编码器及双重目标指导训练,提升了乳腺超声报告生成的相似性和描述符恢复能力。

Comments 17 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12278 2026-07-15 cs.CV cs.LG 新提交 62%

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

全切片图像多模态基准测试中的数据泄露审计

Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Merck & Co., Inc.(默克公司)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV、cs.LG

AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07328 2026-07-10 cs.LG cs.AI cs.CV cs.CY 版本更新 62%

MultiFair: Multimodal Balanced Fairness-Aware Medical Classification with Dual-Level Gradient Modulation

MultiFair:具有双级梯度调制的多模态平衡公平感知医学分类

Md Zubair, Hao Zheng, Grayson W. Armstrong, Lucy Q. Shen, Gabriela Wilson, Yu Tian, Xingquan Zhu

机构 * School of Computing and Informatics, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校计算机与信息学学院) Louisiana Center for Health Innovation and College of Nursing & Health Sciences, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校健康创新中心及护理与健康科学学院) Massachusetts Eye and Ear, Harvard Medical School(哈佛医学院马萨诸塞眼耳医院) Department of Computer Science, University of Central Florida(佛罗里达州立大学计算机科学系) Department of Electrical Engineering and Computer Science, Florida Atlantic University(佛罗里达Atlantic大学电子工程与计算机科学系)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 针对多模态医学分类中数据模态学习不均衡和模型对特定群体不公平的问题,提出MultiFair方法,通过双级梯度调制过程动态调整训练梯度,在多数据集上评估,有效解决了上述挑战。

Comments This work has been accepted for publication in IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17117 2026-06-30 cs.CV cs.AI cs.LG 62%

PlantExpertVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science

PlantExpertVQA: 一个用于植物科学中视觉语言模型基准测试的视觉问答数据集

Syed Nazmus Sakib, Nafiul Haque, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 PlantExpertVQA数据集旨在提升视觉语言模型在农业决策中的应用,包含765,186个高质量问答对,涵盖38种作物和89种病害,通过多阶段流程生成并经专家审核,验证了参数高效微调的有效性。

Comments 36 pages, 9 figures, 14 tables and Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 62%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 62%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15408 2026-06-09 cs.CV cs.AI cs.CL cs.LG 版本更新 62%

CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation

CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成

Pablo Messina, Andrés Villa, Juan León Alcázar, Karen Sánchez, Carlos Hinojosa, Denis Parra, Álvaro Soto, Bernard Ghanem

机构 * Pontificia Universidad Católica de Chile(智利天主教大学) CENIA iHEALTH KAUST(科威特皇家科学与技术局)

专题命中 医疗多模态 :radiology(abstract);分类 cs.CV、cs.LG

AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。

Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04613 2026-06-04 cs.CV cs.LG 62%

Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

超越对称对齐:医学领域视觉-语言模型中模态不平衡的光谱诊断

Alessandro Gambetti, Qiwei Han, Cláudia Soares, Hong Shen

机构 * NOVA School of Science and Technology(诺瓦科学与技术学校) Nova School of Business and Economics(诺瓦商业与经济学校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 提出非对称光谱对齐分数(SAS),通过特征值加权的特征模态相关性量化模态信息不平衡,并在医学图像-文本数据集上评估15个VLM,发现医学图像比临床报告保留更丰富的结构信息,且SAS与检索性能的相关性最强。

Comments 10 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04433 2026-06-04 cs.CV cs.CL cs.LG 62%

Stateful Visual Encoders for Vision-Language Models

用于视觉-语言模型的有状态视觉编码器

Zirui Wang, Junwei Yu, Adam Yala, David M. Chan, Joseph E. Gonzalez, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 医疗多模态 :radiology(abstract);分类 cs.CV、cs.LG

AI总结 提出有状态视觉编码器,通过将每个视觉表示条件于先前的视觉特征,增强视觉-语言模型在多图像、多轮交互中的视觉变化感知能力,在跨图像空间聚合、多目标视觉差异和轨迹行为克隆等任务上取得一致改进。

Comments Project page: https://statefulvisualencoders.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27194 2026-05-27 cs.CL cs.CV cs.LG 62%

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

并非所有标记都同等重要:基于关键标记监督的动态上下文向量蒸馏用于长医学报告生成

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV、cs.LG

AI总结 提出DIVE框架,通过关键标记监督和状态条件动态引导,解决长文本生成中标记级蒸馏忽略关键标记的问题,在医学报告生成任务上取得最佳性能。

Comments Preprint. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12031 2026-05-13 cs.LG cs.CV 62%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05594 2026-05-08 cs.CL cs.CV cs.LG 62%

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文的成本:减轻多模态检索增强生成中的文本偏差

Hoin Jung, Xiaoqian Wang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫夫家族电气与计算机工程学院)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了多模态大语言模型在整合检索增强生成时出现的文本偏差问题,提出BAIR方法通过恢复视觉显著性并施加位置感知惩罚来提升多模态接地和诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03248 2026-04-27 cs.LG cs.AI cs.CV physics.med-ph 62%

Multimodal Neural Operators for Real-Time Biomechanical Modelling of Traumatic Brain Injury

多模态神经算子用于创伤性脑损伤的实时生物力学建模

Anusha Agarwal, Dibakar Roy Sarkar, Somdatta Goswami

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院)

专题命中 医疗多模态 :biomedical(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多模态神经算子架构用于创伤性脑损伤的生物力学建模,通过融合体积解剖影像、人口特征和采集参数,预测全字段脑位移,验证了DeepONet在准确性、速度和参数量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17209 2026-04-21 cs.CV cs.AI eess.SP 62%

DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

DREAM:动态视网膜增强与自适应多模态融合用于专家精准医疗报告生成

Nagur Shareef Shaik, Teja Krishna Cherukuri, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV、eess.SP

AI总结 DREAM通过动态多模态融合提升视网膜图像医疗报告生成精度,在数据有限时仍能生成高质量报告,实现BLEU-4 0.241的SOTA表现。

Comments Accepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG 62%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26952 2026-03-31 cs.CV cs.LG 62%

Multimodal Deep Learning for Diabetic Foot Ulcer Staging Using Integrated RGB and Thermal Imaging

多模态深度学习在结合RGB和热成像的糖尿病足溃疡分期中的应用

Gulengul Mermer, Mustafa Furkan Aksu, Gozde Ozsezer, Sevki Cetinkalp, Orhan Er, Mehmet Kemal Gullu

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了多模态图像对深度学习模型在糖尿病足溃疡分期中的影响,通过RGB和热成像数据结合提升模型性能,VGG16模型在RGB+热成像数据集上达到93.25%的准确率。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20046 2026-02-24 cs.CV cs.LG 62%

Closing the gap in multimodal medical representation alignment

弥合多模态医学表征对齐的差距

Eleonora Grassucci, Giordano Cicchetti, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 医疗多模态 :radiology(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种模态无关的框架,用于弥合多模态医学表征对齐中的模态差距,提升放射学图像与临床文本之间的对齐效果。

Comments Accepted at MLSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 62%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14498 2026-02-23 cs.CV cs.LG 62%

Uncertainty-Aware Vision-Language Segmentation for Medical Imaging

面向医学影像的不确定性感知视觉-语言分割

Aryan Das, Tanishq Rachamalla, Koushik Biswas, Swalpa Kumar Roy, Vinay Kumar Verma

机构 * VIT Bhopal(维特大学博帕尔分校) SAHE, Andhra Pradesh(安得拉邦SAHE) IIIT Delhi(德里印度理工学院) Tezpur University Assam(阿萨姆特兹普尔大学) IIT Kanpur(坎普尔印度理工学院)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种不确定性感知的多模态分割框架,通过引入SEU损失和MoDAB模块,提升医学影像分割的精度与效率。

Comments Accepted in WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 62%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14901 2026-02-17 cs.LG cs.AI cs.CV cs.MA 62%

Picking the Right Specialist: Attentive Neural Process-based Selection of Task-Specialized Models as Tools for Agentic Healthcare Systems

选择合适的专家:基于神经过程的注意力机制用于选择任务专用模型作为智能医疗系统工具

Pramit Saha, Joshua Strong, Mohammad Alsharid, Divyanshu Mishra, J. Alison Noble

机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) Department of Computer Science, Khalifa University, Abu Dhabi, United Arab Emirates(哈利法大学计算机科学系)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ToolSelect,一种基于神经过程和注意力机制的模型选择方法,用于智能医疗系统中选择任务专用模型,通过实验展示其在不同任务上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08249 2026-02-10 eess.IV cs.CV 62%

A Unified Framework for Multimodal Image Reconstruction and Synthesis using Denoising Diffusion Models

基于去噪扩散模型的多模态图像重建与合成统一框架

Weijie Gan, Xucheng Wang, Tongyao Wang, Wenshang Wang, Chunwei Ying, Yuyang Hu, Yasheng Chen, Hongyu An, Ulugbek S. Kamilov

机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)

专题命中 医疗多模态 :CT(abstract);分类 cs.CV、eess.IV

AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏