arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-05-14 至 2026-05-14 共收录 5 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 5 篇

2604.02022 2026-05-14 cs.AI 78%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 医学数据与评测 :diagnosis(title,abstract)

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 70%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 医学数据与评测 :medical image(abstract);diagnosis(abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04999 2026-05-14 stat.ME 50%

A Tutorial for Evaluating Cure Model Appropriateness

评估治愈模型适用性的教程

A Tutorial for Evaluating Cure Model Appropriateness Geethanjalee Mudunkotuwa, Durbadal Ghosh, Subodh Selukar

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出系统评估治愈模型适用性的方法,结合临床判断、Kaplan-Meier曲线分析和定量评估,通过骨髓移植数据示例提供实用指导,提升生存分析可靠性。

Comments 24 pages, 2 figues, to be submitted in Statistics in Medicine, First two authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02038 2026-05-14 cs.CL cs.AI cs.DB 50%

BEAVER: An Enterprise Benchmark for Text-to-SQL

BEAVER:一个企业文本到SQL基准测试

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) Greenshoe, Inc.(Greenshoe公司)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 BEAVER是首个基于企业私有数据仓库构建的文本到SQL基准测试,包含9128个问题-SQL对和19个领域的812张表,通过合成高质量查询和细粒度评估方法,揭示了现有模型在复杂企业场景下的性能差距。

Comments Dataset and code are available at https://beaverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 50%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏