arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-05-18 至 2026-05-18 共收录 3 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 生物医学文本 3 篇

2605.15766 2026-05-18 cs.CE 78%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 生物医学文本 :biomedical(title,abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15053 2026-05-18 cs.LG cs.AI 70%

TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale

TFGN:无需任务和回放的连续预训练,避免灾难性遗忘的LLM规模

Anurup Ganguli

机构 * Independent Researcher(独立研究者)

专题命中 生物医学文本 :biomedical(abstract,abstract_cn);分类 cs.LG

AI总结 TFGN通过输入条件化、参数高效更新,在无需回放或任务标签的情况下,实现了在异构文本领域连续预训练,避免灾难性遗忘,展示了跨领域正向迁移和高梯度分离。

Comments 65 pages, 10 figures, 40 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15589 2026-05-18 cs.CL 50%

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

MHGraphBench: 用于评估大语言模型中心理健康知识的图知识基准

Weixin Liu, Congning Ni, Shelagh A. Mulvaney, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 生物医学文本 :biomedical(abstract)

AI总结 本文提出MHGraphBench基准,评估大语言模型在心理健康实体识别、关系判断及双跳推理能力,发现模型在实体类型识别和小关系类型判断上表现优异,但在关系预测和双跳推理上仍有不足,且输出格式可靠性对性能有显著影响。

Comments Accepted to GEM 2026, ACL 2026 Workshop; 9 pages main text plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏