arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-03-17 至 2026-03-17 共收录 96 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 11 篇

2603.14631 2026-03-17 cs.LG cs.AI cs.CL 57%

Anterior's Approach to Fairness Evaluation of Automated Prior Authorization System

前向方法用于自动化预先授权系统的公平性评估

Sai P. Selvaraj, Khadija Mahmoud, Anuj Iravane

专题命中 医学数据与评测 :healthcare AI(abstract);分类 cs.LG

AI总结 本文提出基于模型误差率而非审批结果的公平性评估框架,评估7166例人类审查案例中性别、年龄、种族/民族和经济状况的一致性,发现大多数人口群体中模型误差率一致,但种族/民族子群体样本量有限,导致置信区间宽且检验力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14426 2026-03-17 cs.CV cs.IR cs.MM 57%

GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos

GenState-AI:面向AI生成视频的基于状态的文本到视频检索数据集

Minghan Li, Tongna Chen, Tianrui Lv, Yishuai Zhang, Suchao An, Guodong Zhou

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出GenState-AI数据集,通过可控状态转换和显式端状态标注,解决文本到视频检索中时间推理和端状态定位不足的问题,评估两种基线模型并分析时间与语义混淆源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13557 2026-03-17 cs.CV 57%

Performance evaluation of deep learning models for image analysis: considerations for visual control and statistical metrics

深度学习模型在图像分析中的性能评估:视觉控制和统计指标的考虑

Christof A. Bertram, Jonas Ammeling, Alexander Bartel, Gillian Beamer, Marc Aubreville

机构 * University of Veterinary Medicine Vienna(维也纳兽医学院) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学) Freie Universität Berlin(柏林自由大学) Hochschule Flensburg(弗劳恩霍夫应用技术大学) Johnson & Johnson Innovative Medicine(强生创新医学)

专题命中 医学数据与评测 :pathology(abstract);分类 cs.CV

AI总结 本文探讨了深度学习在图像分析中的性能评估方法,比较了视觉控制与统计指标的优劣,并讨论了统计评估中的关键考虑因素,强调两者结合对理解模型性能和误差来源的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00744 2026-03-17 cs.CV 57%

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

先定位后回答:一种用于基于地面的医学多模态大语言模型的幻觉评估基准

Dung Nguyen, Minh Khoi Ho, Huy Ta, Thanh Tam Nguyen, Qi Chen, Kumar Rav, Quy Duong Dang, Satwik Ramchandre, Son Lam Phung, Zhibin Liao, Minh-Son To, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

专题命中 医学数据与评测 :biomedical(abstract);分类 cs.CV

AI总结 本文提出HEAL-MedVQA基准,通过创新评估协议和67K VQA数据集,评估医学多模态模型的定位能力与幻觉鲁棒性,提出LobA框架提升视觉推理能力,实验结果表明其在挑战性基准中优于现有生物医学LMMs。

Comments Accepted at Joint Conference on Artificial Intelligence (IJCAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15483 2026-03-17 cs.AI 50%

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 50%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏