arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-08-18 至 2026-08-18 共收录 8 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 8 篇

2510.08759 2026-08-18 cs.CV cs.RO 版本更新 79%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L.S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 医学数据与评测 :diagnosis(title,abstract);分类 cs.CV

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14866 2026-08-18 stat.ML cs.LG 新提交 74%

ARISE: An adaptive residual-informed stability ensemble for feature selection in small-sample biomedical omics

ARISE:用于小样本生物医学组学特征选择的自适应残差感知稳定性集成方法

Zardad Khan, Amjad Ali, Naz Gul, Sheema Gul, Saeed Aldahmani

专题命中 医学数据与评测 :biomedical(title);分类 cs.LG

AI总结 该研究提出ARISE方法,整合多类特征选择相关机制,在多组学数据集的小样本分子分类任务中,相比对比方法在多项指标上均取得最优表现。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16494 2026-08-18 cs.LG cs.AI cs.CE eess.SY 新提交 57%

Graph Machine Learning: An Opportunity for Power Systems

图机器学习:电力系统的一个机遇

Martin Sadric, Sebastian Pütz, Christian Nauck, Veit Hagenmeyer, Frank Hellmann, Dirk Witthaut, Benjamin Schäfer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Helmholtz AI(亥姆霍兹人工智能) Potsdam Institute for Climate Impact(波茨坦气候影响研究所)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 该研究调研近800篇图机器学习与电力系统交叉论文,分析其在电力系统多场景的应用价值,指出领域现存挑战,推导电网基准需求目录并呼吁优先开展基准研究与开放资源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20271 2026-08-18 cs.CV 版本更新 57%

A Versatile Foundation Model for AI-enabled Mammogram Interpretation

一种用于AI辅助乳腺X线摄影解读的通用基础模型

Fuxiang Huang, Jiayi Zhu, Yunfang Yu, Yu Xie, Yuan Guo, Qingcong Kong, Mingxiang Wu, Xinrui Jiang, Shu Yang, Jiabo Ma, Ziyi Liu, Zhe Xu, Zhixuan Chen, Yujie Tan, Zifan He, Luhui Mao, Xi Wang, Junlin Hou, Lei Zhang, Qiong Luo, Zhenhui Li, Herui Yao, Hao Chen

机构 * Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心) Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科) Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 研究针对乳腺X线分析基础模型的临床转化缺陷,推出VersaMammo模型,构建含70余万张图像的多机构数据集,经两阶段预训练后在92项临床任务基准中表现顶尖,推动乳腺癌筛查诊断进展。

Comments 69 pages, 12 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 50%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15242 2026-08-18 cs.AI cs.SE 新提交 50%

LongRCA Bench: Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures

LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因

Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong Liu, Hengyue Jiang, Difeng Ma, Jiayi Zhang, Yongzhou Yao, Yanan Zhao, Fei Sun, Yintong Huo, Zhaoyang Liu, Jingjing Li, Gaogang Xie, Dan Pei

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Chongqing University(重庆大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Singapore Management University(新加坡管理大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。

Comments 17 pages, 5 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15223 2026-08-18 cs.CL 新提交 50%

TRACE-BN: Transferring Bangla-English Tutoring Behavior to a Sub-1B Offline Language Model

TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型

Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Mohammad Tushar Abdullah, Asfee Bhuiyan Leen, Sumaiya Tabassum Nimi

机构 * North South University(北南大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 50%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏