arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-03 至 2026-08-03 共收录 6 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 6 篇

2607.01103 2026-08-03 cs.CL 版本更新 71%

Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking

临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性

William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian Löns, Ronald Böck, Sebastian Fudickar

机构 * University of Luebeck(吕贝克大学) University of Tübingen(图宾根大学) University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) University Hospital Würzburg(维尔茨堡大学医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Genie Enterprise Deutschland GmbH

专题命中 医学数据与评测 :medical AI(title)

AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29055 2026-08-03 cs.LG cs.AI cs.MA 新提交 57%

Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search

基于蒙特卡洛树搜索的多智能体系统自主修复

Hanxiao Lu, Tianyi Zhang

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究提出基于蒙特卡洛树搜索的MARS框架,将多智能体系统修复建模为搜索过程,结合分类学增强评估与诊断引导扩展,在StateMAS基准上性能优于现有方法,且令牌消耗相当。

Comments Under conference review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 50%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28841 2026-08-03 cs.MA cs.SE 新提交 50%

CyberNeuro: A Privacy-Preserving Agentic Workbench for Cohort-Scale Neuroimage and Clinical Data Analysis

CyberNeuro:用于队列规模神经影像与临床数据分析的隐私保护智能体工作台

Ran Ren, Junhong Tong, Yunxi Kong, Yiyao Chen, Yucheng Li, Kunhao Zhou, Shaoqi Wang, Yuxiang Tao, Shuheng Cao, Zhihao Fan, Marissa DiPiero, Tingting Dan, Guorong Wu

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 CyberNeuro是配备WandaMind本地LLM的隐私保护智能体工作台,通过四个专用智能体实现神经影像与临床数据分析自动化,在NeuroBench上提升了域准确率,还降低了令牌使用量。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28788 2026-08-03 cs.AI 新提交 50%

EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses

EarlyDx:一个锚定入院时间的开放生成式循证急诊科就诊诊断基准

Jiahui Li, Ruili Fang, Zishuai Liu, Yutong Guo, Nan Yang, Wenzhan Song, Jin Lu, Fei Dou

机构 * University of Georgia(佐治亚大学) Beijing Luhe Hospital(北京潞河医院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出EarlyDx基准,针对现有诊断基准不适用入院诊断场景的问题,基于MIMIC-IV数据构建,发现各类LLM均无法可靠综合入院证据,仅能提取部分诊断,微调后仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03322 2026-08-03 cs.CL cs.AI 版本更新 50%

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

大语言模型能否推导新知识?一种动态生物知识发现基准

Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出DBench-Bio,一种动态生物知识发现基准,通过三阶段流程评估AI的新知识发现能力,揭示当前模型在知识发现上的局限性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏