arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 1750 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 147 篇

2606.09590 2026-06-09 cs.CL cs.CR 新提交 50%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09132 2026-06-09 cs.AI 新提交 50%

Vision Language Model Helps Private Information De-Identification in Vision Data

视觉语言模型助力视觉数据中的隐私信息去标识化

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 医学数据与评测 :medical image(abstract)

AI总结 提出VisShield框架,通过专用指令微调数据集OPTIC和训练策略,使视觉语言模型精准定位并掩码敏感文本,有效保护医学图像等视觉数据中的隐私信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08966 2026-06-09 stat.ME 新提交 50%

Class Imbalance Corrections Failed to Enhance Discrimination, Model Calibration, and Prediction Stability: An Empirical Simulation Study Based on Clinical Dataset

类别不平衡校正未能提升判别能力、模型校准和预测稳定性:基于临床数据集的实证模拟研究

Wachiranun Sirikul, Natthanaphop Isaradech, Wuttipat Kiratipaisarl, Pakpoom Wongyikul, Noraworn Jirattikanwong, Phichayut Phinyo

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本研究通过模拟临床预测模型开发,发现类别不平衡校正(如重采样和算法级调整)不能改善模型判别能力,反而导致校准不良和预测不稳定,建议不应常规进行不平衡校正。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08673 2026-06-09 cs.CL 新提交 50%

ClinicalAligner26AM: A Cross-Lingual Aligner for Dataset Translation; Evidences from the MultiClinCorpus Shared Task

ClinicalAligner26AM: 用于数据集翻译的跨语言对齐器;来自MultiClinCorpus共享任务的证据

François Remy

机构 * Parallia Healthcare AI(Parallia医疗人工智能)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出ClinicalAligner26AM,一种基于ClinicalEncoder26AM初始化的生物医学临床文本多语言对齐模型,通过Sinkhorn-Knop最优传输融合多级信号构建软对齐目标,在MultiClinCorpus任务中跨语言投影实体标注,字符加权F1超0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 50%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 50%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 50%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 50%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他医学AI 2 篇

2606.26494 2026-07-01 cs.AI 新提交 82%

Clinical Harness for Governable Medical AI Skill Ecosystems

可治理医疗AI技能生态系统的临床框架

Tianhan Xu, Lei Bao, Zhe Hu, Tian Shen, Yongxiang Wang

专题命中 其他医学AI :medical AI(title,abstract);clinical AI(abstract)

AI总结 提出临床AI技能与临床框架,通过运行时治理架构注册、编排、守护和监控AI临床能力,以骨质疏松为例展示知识驱动、数据驱动和物理增强技能在生命周期护理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30828 2026-07-01 cs.HC 新提交 78%

Drawing Out Legal Risks: Co-Designing with Lawyers to Predict and Manage Legal Uncertainties of Medical AI Tools

揭示法律风险:与律师共同设计以预测和管理医疗AI工具的法律不确定性

Gennie Mansi, Julia Kim, Michael Rosenbloom, Mark Riedl

专题命中 其他医学AI :medical AI(title,abstract)

AI总结 通过与律师共同设计,识别并可视化医疗AI工具的法律风险,提出预测和管理策略,帮助组织应对法律不确定性。

Comments 13 pages, 8 figures; Note: This paper is formatted as a submission type called a Pictorial, used in some ACM venues (e.g. https://dis.acm.org/2026/pictorials/). Pictorials present visual components (e.g. study artifacts, diagrams) with text to convey contributions. We present co-created visualizations from our study alongside our analysis/. For more justification of the format, see page 4

详情

展开后加载摘要…

URL PDF HTML 收藏