arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-03-17 至 2026-03-17 共收录 11 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 11 篇

2603.13422 2026-03-17 eess.IV cs.CV cs.LG 82%

Projection Guided Personalized Federated Learning for Low Dose CT Denoising

投影引导的个性化联邦学习用于低剂量CT去噪

Anas Zafar, Muhammad Waqas, Amgad Muneer, Rukhmini Bandyopadhyay, Jia Wu

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 医学数据与评测 :CT(title,abstract);分类 cs.CV、cs.LG、eess.IV

AI总结 本文提出ProFed框架,通过在投影空间进行双层个性化,解决联邦学习中图像空间个性化难以区分扫描器噪声与患者解剖结构的问题,实验表明其在低剂量CT去噪中性能优越。

Comments 17 pages, 3 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14848 2026-03-17 cs.CV 74%

Personalized Federated Learning with Residual Fisher Information for Medical Image Segmentation

具有残差信息鱼尔矩阵的个性化联邦学习用于医学图像分割

Meilu Zhu, Yuxing Li, Zhiwei Wang, Edmund Y. Lam

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(电子与电气工程系,香港大学,香港,中国)

专题命中 医学数据与评测 :medical image(title);分类 cs.CV

AI总结 本文提出pFL-ResFIM框架,通过残差信息鱼尔矩阵量化模型参数对领域差异的敏感性,实现客户端自适应个性化,在公共数据集上验证了其有效性。

Comments accepted by ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15107 2026-03-17 cs.LG cs.DL 70%

Limitations of Public Chest Radiography Datasets for Artificial Intelligence: Label Quality, Domain Shift, Bias and Evaluation Challenges

公共胸部X光数据集在人工智能中的局限性:标签质量、领域转移、偏见和评估挑战

Amy Rafferty, Ajitha Rajan

专题命中 医学数据与评测 :pathology(abstract);radiology(abstract);分类 cs.LG

AI总结 研究指出公共胸部X光数据集在标签质量、领域偏移、偏见和评估方面存在局限,通过跨模型架构分析发现外部性能显著下降,且专家审查揭示标签存在显著分歧,强调需更公平的评估框架和临床验证数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 70%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 医学数据与评测 :medical AI(abstract);diagnosis(abstract);分类 cs.LG

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15539 2026-03-17 cs.LG 57%

Vib2ECG: A Paired Chest-Lead SCG-ECG Dataset and Benchmark for ECG Reconstruction

Vib2ECG:一种配对的胸导体SCG-ECG数据集和用于ECG重建的基准

Guorui Lu, Xiaohui Cai, Todor Stefanov, Qinyu Chen

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿先进计算机科学研究所(LIACS)、莱顿大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 本文提出Vib2ECG数据集,用于从低成本振动信号重建ECG,展示了轻量U-Net在多导联ECG重建中的可行性,并分析了模型生成虚假ECG波形的问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14631 2026-03-17 cs.LG cs.AI cs.CL 57%

Anterior's Approach to Fairness Evaluation of Automated Prior Authorization System

前向方法用于自动化预先授权系统的公平性评估

Sai P. Selvaraj, Khadija Mahmoud, Anuj Iravane

专题命中 医学数据与评测 :healthcare AI(abstract);分类 cs.LG

AI总结 本文提出基于模型误差率而非审批结果的公平性评估框架,评估7166例人类审查案例中性别、年龄、种族/民族和经济状况的一致性,发现大多数人口群体中模型误差率一致,但种族/民族子群体样本量有限,导致置信区间宽且检验力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 57%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13557 2026-03-17 cs.CV 57%

Performance evaluation of deep learning models for image analysis: considerations for visual control and statistical metrics

深度学习模型在图像分析中的性能评估:视觉控制和统计指标的考虑

Christof A. Bertram, Jonas Ammeling, Alexander Bartel, Gillian Beamer, Marc Aubreville

机构 * University of Veterinary Medicine Vienna(维也纳兽医学院) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学) Freie Universität Berlin(柏林自由大学) Hochschule Flensburg(弗劳恩霍夫应用技术大学) Johnson & Johnson Innovative Medicine(强生创新医学)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV

AI总结 本文探讨了深度学习在图像分析中的性能评估方法,比较了视觉控制与统计指标的优劣,并讨论了统计评估中的关键考虑因素,强调两者结合对理解模型性能和误差来源的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 57%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15483 2026-03-17 cs.AI 50%

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 50%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏