arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-12 至 2026-08-12 共收录 3 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 3 篇

2608.10273 2026-08-12 cs.CL cs.AI 新提交 50%

Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

可本地部署的小型语言模型用于急诊科决策支持:微调策略的系统基准测试

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究针对急诊科决策支持的隐私风险,通过基准测试发现经LoRA微调的开源小型语言模型在分诊和转诊任务上优于商业模型,可本地部署且具备临床竞争力。

Comments Accepted to AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18013 2026-08-12 cs.SE 50%

JunoBench: A Benchmark Dataset of Crashes in Python Machine Learning Jupyter Notebooks

JunoBench: 一个Python机器学习Jupyter笔记本崩溃的基准数据集

Yiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 JunoBench通过提供真实崩溃案例、修复方案和详细标注,促进Jupyter笔记本中机器学习bug检测、定位、诊断与修复的研究。

Journal ref Proceedings of the 3rd ACM International Conference on AI-Powered Software (AIware), pp 406-413, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19001 2026-08-12 cs.CL 版本更新 50%

HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces

当安全失败之前:在推理链中基准测试有害行为检测

Ishita Kakkar, Enze Zhang, Rheeya Uppaal, Junjie Hu

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出HarmThoughts基准,用于评估推理链中逐步的安全性。通过分析56931个句子,识别有害行为传播模式,发现现有检测器在细粒度行为检测上存在不足,揭示了过程级安全监控的关键缺口。

Comments Accepted at COLM 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏