arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 1717 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 77 篇

2607.03740 2026-07-09 q-bio.QM cs.CV eess.IV 新提交 77%

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography

基于裂隙灯摄影的微生物性角膜炎亚型诊断三相多模态知识聚合框架

Yiqing Wang, Maria A. Woodward, Ziyun Yang, N. Venkatesh Prajna, Chunming He, Leslie M. Niziol, Mercy Pawar, Ming-Chen Lu, Guillermo Amescua, Rachel Wozniak, Sejal Amin, Abinaya Krishnan, Prabhleen Kochar, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Kellogg Eye Center, Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学凯洛格眼科中心,眼科学与视觉科学系) Department of Cornea and Refractive Surgery Services, Aravind Eye Care System(阿瓦因眼科医疗系统角膜与屈光手术部) Bascom Palmer Eye Institute, Department of Ophthalmology, University of Miami Miller School of Medicine(迈阿密大学米勒医学院巴斯科姆·帕勒眼科研究所,眼科学系) Flaum Eye Institute, Department of Ophthalmology, University of Rochester Medical Center(罗切斯特大学医学中心弗劳姆眼科研究所,眼科学系) Department of Ophthalmology, Henry Ford Hospital(亨利福特医院眼科部) Duke Eye Center, Duke University School of Medicine(杜克大学医学院杜克眼科中心)

专题命中 医疗多模态 :diagnosis(title);分类 cs.CV、q-bio、eess.IV

AI总结 针对传统微生物性角膜炎病原体鉴定慢、成本高的问题,提出融合多模态信息的三相框架实现角膜炎亚型分类,经多中心验证性能优异,跨站点泛化评估更具参考性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 75%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 医疗多模态 :medical AI(abstract);clinical AI(abstract);diagnosis(abstract)

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12953 2026-06-12 cs.AI cs.CV cs.LG eess.IV 新提交 75%

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

OpenMedQ:面向医学视觉语言模型的广泛开放预训练

Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学)

专题命中 医疗多模态 :pathology(abstract);radiology(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 提出OpenMedQ,在14个数据集(约335万样本)上预训练医学视觉语言模型,在PathVQA上BLEU-1达75.9,超越562B参数的Med-PaLM M,并在8个未见医学分类任务上取得最高平均macro-F1(0.757)。

Comments Medical Imaging with Deep Learning (MIDL) 2026, Short Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12677 2026-08-14 cs.AI cs.CV 新提交 74%

The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis

自然语言理解在基于多模态视频的登革热诊断中的作用

Danial Sharifrazi, Saadat Behzadi, Julakha Jahan Jui, Mojtaba Mohammadi, Nouman Javed, Roohallah Alizadehsani, Prasad N. Paradkar, Asim Bhatti

专题命中 医疗多模态 :diagnosis(title);分类 cs.CV

AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 74%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 医疗多模态 :radiology(title);分类 cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20852 2026-06-23 cs.CV cs.AI 新提交 74%

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) Stanford University School of Medicine(斯坦福大学医学院) DASA University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) Eden

专题命中 医疗多模态 :radiology(title);分类 cs.CV

AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19053 2026-06-18 cs.CV 新提交 74%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

大规模视觉-语言模型在细粒度图像任务上的基准测试:从评估到诊断

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, School of Intelligence Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院以及新一代人工智能技术及其交叉应用关键实验室,中国) Wangxuan Institute of Computer Technology, National Key Laboratory for Multimedia Information Processing, Peking University, China(北京大学王轩计算机技术研究所、多媒体信息处理国家重点实验室,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 医疗多模态 :diagnosis(title);分类 cs.CV

AI总结 提出FG-BMK基准,含101万问题和28万图像,通过人机双范式评估LVLM的细粒度语义识别与视觉判别能力,诊断失败原因,发现视觉表示、语义对齐等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11472 2026-08-13 cs.CV cs.LG 新提交 73%

Gaussian Meta-Space Augmentation for Stacking Ensembles in Multimodal IPMN Risk Stratification

用于多模态IPMN风险分层的堆叠集成的高斯元空间增强

Max A. Nelson, Eminenur Sen Tasci, Zhixiang Wang, Zongwei Zhou, Halil Ertugrul Aktas, Andrea M. Bejar, Elif Keles, Ziliang Hong, Sıtkı Safa Taflan, Muhammed Enes Tasci, Frank H. Miller, Michael B. Wallace, Rajesh N. Keswani, Gorkem Durak, Ulas Bagci

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰斯·霍普金斯大学) Istanbul University(伊斯坦布尔大学) Mayo Clinic Florida(佛罗里达州梅奥诊所)

专题命中 医疗多模态 :MRI(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究针对IPMN风险分层问题,提出cUPMI方法并结合多模态信息融合,构建RF堆叠模型,在多中心分析中取得优于基线的性能。

Comments Accepted at the International Workshop on Machine Learning in Medical Imaging (MLMI 2026), held in conjunction with MICCAI 2026. This is the authors' accepted manuscript; the final version will appear in Springer Lecture Notes in Computer Science (LNCS). 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07673 2026-07-09 cs.CV cs.LG 新提交 73%

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架

Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen

机构 * Yale University(耶鲁大学) Korea University(韩国大学) Washington University in St. Louis(圣路易斯华盛顿大学) The University of Queensland(昆士兰大学) The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 医疗多模态 :medical image(abstract);biomedical(abstract);分类 cs.CV、cs.LG

AI总结 研究针对医学多模态基础模型受高质量临床数据限制问题,提出MedPMC框架,将文献转化为高保真基础设施。经实验,该框架整理大量图像-文本对,在多方面评估表现出色,训练模型在多基准测试和临床场景中效果显著,还公开相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 73%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 医疗多模态 :MRI(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01462 2026-08-04 cs.AI 新提交 71%

Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI

大声还是沉默?一种用于多模态临床AI中模态级失败分析的可复用框架

Quang Bui, Shlok Jaiswal, Samuel Paik-Heintz, Kevin Zhou, Kaushik Madapati, Krittaphas Chaisutyakorn, Noah Dane Hebdon, Dimitrios Proios, Sebastián Andrés Cajas Ordóñez, Kacper Dobek, Boya Zhang, Aly Dhedhi, Ahram Han, Kushul Reddy Palakala, Rahul Gorijavolu, Jacques Kpodonu, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) American International School Vienna(维也纳美国国际学校) Neuqua Valley High School(纽夸谷高中) North Hollywood High School(北好莱坞高中) Hopewell Valley Central High School(霍普韦尔谷中央高中) University of California, Berkeley(加州大学伯克利分校) Siriraj Hospital(诗里拉吉医院) Harvard University(哈佛大学) Agency for Science, Technology and Research(新加坡科技研究局) Johns Hopkins University(约翰斯·霍普金斯大学) University of Geneva(日内瓦大学) Poznan University of Technology(波兹南理工大学)

专题命中 医疗多模态 :clinical AI(title)

AI总结 该研究提出一种模型无关的多模态临床AI模态级失败分析框架,可复用且仅用部署可观测信号,经植入真实值和MIMIC-IV队列验证,能定位失败模态、区分失败类型,为心脏基础模型部署提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交 71%

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 医疗多模态 :diagnosis(title)

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 70%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 医疗多模态 :pathology(abstract);biomedical(abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交 70%

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 70%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 医疗多模态 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交 70%

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

专题命中 医疗多模态 :pathology(abstract);diagnosis(abstract);分类 cs.CV

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08420 2026-06-26 cs.CV 新提交 70%

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs

CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模

Sergios Gatidis, Curtis Langlotz, Christian Bluethgen

机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) Department of Radiology, Stanford University(斯坦福大学放射学系)

专题命中 医疗多模态 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16573 2026-06-16 cs.CV 新提交 70%

Transformation-driven generation of comparable projection images from multimodal anatomical scenes

从多模态解剖场景生成可比较投影图像的变换驱动方法

Dariusz Pojda, Krzysztof Domino, Michał Tarnawski, Agnieszka Anna Tomaka

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所)

专题命中 医疗多模态 :CT(abstract,abstract_cn);分类 cs.CV

AI总结 提出变换驱动框架,从多模态解剖数据生成可重复的投影空间观测,通过下颌运动场景验证,实现不同解剖配置下直接可比的虚拟X光投影生成。

Comments 36 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08071 2026-08-11 cond-mat.mtrl-sci 新提交 67%

Multimodal deep learning framework to predict strain localization of Mg/LPSO two-phase alloys

预测Mg/LPSO两相合金应变局域化的多模态深度学习框架

Daiki Kuriki, Fabien Briffod, Takayuki Shiraiwa, Manabu Enoki

专题命中 医疗多模态 :CT(abstract,abstract_cn)

AI总结 本研究采用多模态深度学习框架,结合三种微观结构描述符,从三维图像预测Mg/LPSO两相合金的压缩局域应变分布,验证了方法的有效性。

Comments Published in Acta Materialia, Volume 281, 120398 (2024)

Journal ref Acta Materialia 281 (2024) 120398

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15565 2026-07-20 cs.CV cs.AI cs.LG eess.IV 新提交 67%

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21496 2026-07-24 eess.SP cs.LG 新提交 62%

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

使用基于语音的多模态大语言模型实现可泛化的认知障碍检测

Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao

机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada School of Basic Medical Sciences, Hebei University, Baoding 071000, China Department of Civil \& Environmental Engineering School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG、eess.SP

AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12278 2026-07-15 cs.CV cs.LG 新提交 62%

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

全切片图像多模态基准测试中的数据泄露审计

Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Merck & Co., Inc.(默克公司)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV、cs.LG

AI总结 研究针对计算病理学中WSI VQA基准测试数据泄露问题,通过追踪标识符发现患者级和机构级泄露,证明其可从基础模型特征空间解码,导致准确率差距,当前评估无法区分推理与检索,最后给出无污染评估建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 62%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 62%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19624 2026-07-23 cs.CV 新提交 61%

Pathologist Attention-Aligned Report Generation for Prostate Histopathology

用于前列腺组织病理学的病理学家注意力对齐报告生成

Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty, Pierre Marza, Oksana Yaskiv, Constantin Friedman, Natallia Sheuka, Paul Friedman, Bharat Ramlal, Beatrice Knudsen, Rajarsi Gupta, Joel Saltz, Prateek Prasanna, Gregory Zelinsky, Dimitris Samaras

机构 * Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系) Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系) Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元) Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室) Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部) Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系) Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV;medical image(comments)

AI总结 研究将人类注意力引入前列腺病理报告生成模型训练,收集多模态数据集,通过注意力对齐损失微调模型,在两个模型上评估,在报告生成和视觉问答任务中取得较好效果,模型注意力图与病理学家注意力更对齐。

Comments 11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11024 2026-08-12 cs.CV 新提交 57%

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究

Yufei Zhang, Chenlu Zhan, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02692 2026-08-05 cs.LG 新提交 57%

PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks

PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法

Julia Gehrmann, Lars Quakulinski, Hamza Naseem, Oya Beyan

专题命中 医疗多模态 :clinical AI(abstract);分类 cs.LG

AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交 57%

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00976 2026-08-04 cs.CV 新提交 57%

Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

面向医学视觉基础模型的位置感知细粒度表示学习

Myeongkyun Kang, Yanting Yang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(矢量研究所)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 本研究提出基于位置感知细粒度表示学习的医学视觉基础模型LoFi,构建大规模医学定位数据集MedG,在多项医学视觉任务中性能优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 57%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏