Do Pathology Vision-Language Models Truly See Pathology?
病理学视觉语言模型真的能‘看到’病理学吗?
专题命中 医疗多模态 :pathology(title,abstract);分类 cs.CV
AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。
科学与医疗
医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。
病理学视觉语言模型真的能‘看到’病理学吗?
专题命中 医疗多模态 :pathology(title,abstract);分类 cs.CV
AI总结 研究病理学视觉语言模型评估中被忽视的问题,提出含多类型样本的PathBind基准,通过对多个VLMs评估发现,当前病理学VLMs在答案性能与视觉语义绑定间有显著差距。
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada ; School of Basic Medical Sciences, Hebei University, Baoding 071000, China ; Department of Civil \& Environmental Engineering ; School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG、eess.SP
AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。
孙悟空爆炸:一个统一的科学多模态基础模型
机构 * Shanghai Academy of AI for Science(上海人工智能研究院)
专题命中 医疗多模态 :medical image(abstract);分类 cs.LG
AI总结 研究针对科学多领域推理需求,引入统一科学多模态模型MKB,围绕共享Transformer主干及定制组件构建,涵盖多科学分支。通过两阶段训练,在多方面实验表现出色,证明该范式可行,为跨领域科学多模态探索提供基础。