arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2124 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2124 篇

2605.23985 2026-05-26 cs.DB cs.IR 50%

Federated Semantic Knowledge Graphs for Laboratory Workflows: A Structured Expert Elicitation Methodology Demonstrated Through Bioanalytical Workflow Twins

面向实验室工作流的联邦语义知识图谱:通过生物分析工作流孪生展示的结构化专家启发方法

Luis F. Schachner, Vinith Thamizhazhagan, Sara Tanenbaum, John C. Tran, Pamela P. F. Chan, Mandy Kwong, Andy Chang, Maureen Beresini, Margaret Porter Scott

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出一种可重复的结构化专家启发方法和联邦语义知识图谱架构,用于捕获和查询实验室工作流中的隐性知识,并通过Genentech的部署案例展示了跨子图查询能力,特别是识别自动化掩盖的静默故障。

Comments 48 pages, 4 figures, 3 appendices. Submitted to ISWC 2026 In-Use Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26411 2026-05-25 cs.AI 50%

MedSAE: Dissecting MedCLIP Representations with Sparse Autoencoders

MedSAE: 用稀疏自编码器剖析MedCLIP表示

Riccardo Renzulli, Colas Lepoutre, Enrico Cassano, Marco Grangetto

机构 * University of Turin(都灵大学) École polytechnique(巴黎-萨克勒高等理工学院)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 提出MedSAE方法,通过稀疏自编码器解析MedCLIP的潜在空间,结合相关性指标、熵分析和自动神经元命名框架,在CheXpert数据集上验证了比原始MedCLIP特征更高的单语义性和可解释性。

Comments Accepted at ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21645 2026-05-22 cs.AI cs.DB 50%

AOP-Wiki EMOD 3.0: Data Model Expansions and Content Evaluation Framework for Using Agentic AI to Improve Integration between AOPs and New Approach Methodologies (NAMs)

AOP-Wiki EMOD 3.0: 数据模型扩展和内容评估框架用于利用代理AI改进AOP与新方法论(NAMs)之间的整合

Virginia K. Hench, J. Harry Caufield, Sierra A. T. Moxon, Jason M. O'Brien, Stephen W. Edwards

机构 * Open BioData Modeling(开放生物数据建模) Environmental Genomics and Systems Biology(环境基因组学与系统生物学) Lawrence Berkeley National Laboratory(伯克利国家实验室) National Wildlife Research Centre(国家野生动物研究中心) UL Research Institutes - Chemical Insights(UL研究机构-化学洞察)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出AOP-Wiki EMOD 3.0,通过数据模型扩展和内容评估框架,利用代理AI改进AOP与新方法论之间的整合,为监管科学和生物医学领域提供支持。

Comments 7 Figures and 3 Supplemental Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI 50%

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18327 2026-05-19 cs.AI 50%

Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows

Causely: 企业AI中的因果智能层 一项关于SRE和可靠性工作流的基准研究

Dhairya Dalal, Endre Sara, Ben Yemini, Christine Miller, Shmuel Kliger

机构 * Causely

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出Causely,一种企业AI的因果智能层,通过维护环境拓扑、属性依赖性和因果关系的结构化表示,为AI代理提供语义和因果基础,以诊断、评估影响并安全地在生产环境中操作。通过在受控环境下注入故障的24微服务OpenTelemetry演示应用进行基准研究,评估了Causely的价值主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16990 2026-05-19 cs.AI cs.CE 50%

Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation

Conv-FinRe:一种用于实用导向财务推荐的对话和纵向基准

Yan Wang, Yi Han, Lingfei Qian, Yueru He, Xueqing Peng, Dongji Feng, Zhuohan Xie, Vincent Jim Zhang, Rosie Guo, Fengran Mo, Jimin Huang, Yankai Chen, Xue Liu, Jian-Yun Nie

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) California State University(加州州立大学) University of Montreal(蒙特利尔大学) The University of Manchester(曼彻斯特大学) McGill University(麦吉尔大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本研究提出Conv-FinRe基准,用于评估金融推荐模型在对话和长期视角下的实用性,通过多视角参考区分描述性行为与基于投资者风险偏好的规范性效用,揭示理性决策与行为一致性的张力。

Comments Accepted by SIGIR 2026 Resource Track. Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16927 2026-05-19 cs.AI 50%

From Static Risk to Dynamic Trajectories: Toward World-Model-Inspired Clinical Prediction

从静态风险到动态轨迹:迈向世界模型启发的临床预测

Pujun Feng, Xiaoyu Guo, Seyed Ehsan Saffari, Min Hun Lee, Siew-Kei Lam, Erik Cambria, Xibin Sun, Yangtao Zhou, Tong Yang, Xiaoyu Zhang, Tao Tan, Yue Sun, Bin Cui

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息系统学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Public Health, Peking University(北京大学公共卫生学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computer, Peking University(北京大学计算机学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Centre for Biomedical Data Science, Duke-NUS Medical School, National University of Singapore(新加坡国立大学杜克-国立新加坡医学学院生物医学数据科学中心) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克-国立新加坡医学学院AI+医学科学计划)

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 本文探讨了临床AI中干预感知的疾病轨迹建模方法,提出了统一框架,结合了预测、反事实轨迹和政策评估,以解决治疗分配、时间变化混杂和观察偏差问题,推动临床预测向决策级证据发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15401 2026-05-19 cs.CR 50%

Multi-Input Ciphertext Multiplication for Homomorphic Encryption

多输入密文乘法用于同态加密

Sajjad Akherati, Xinmiao Zhang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出多输入密文乘法方法,通过理论分析和硬件设计优化,减少计算复杂度和资源消耗,提升同态加密效率。

Comments 13 Pages, 6 Figures, 7 Tables, Journal paper

Journal ref IEEE Transactions on Circuits and Systems I: Regular Papers ( Early Access ), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 50%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14261 2026-05-15 cs.AI cs.GT 50%

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

启发式病态及通过不确定性传播进一步方差缩减在AIVAT技术家族中

Juho Kim, Tuomas Sandholm

机构 * CMU Strategic Machine, Inc.(CMU战略机器公司) Strategy Robot, Inc.(策略机器人公司) Optimized Markets, Inc.(优化市场公司)

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文探讨了AIVAT技术中启发式价值函数的潜在漏洞,并通过不确定性传播进一步减少方差,实验显示可减少43%的样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20571 2026-05-15 cs.AI 50%

CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation

因果推理基准:用于解耦评估因果识别和估计的现实世界基准

Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出CausalReasoningBenchmark,通过173个查询和132个现实数据集评估因果识别与估计,揭示模型在研究设计细节上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04999 2026-05-14 stat.ME 50%

A Tutorial for Evaluating Cure Model Appropriateness

评估治愈模型适用性的教程

A Tutorial for Evaluating Cure Model Appropriateness Geethanjalee Mudunkotuwa, Durbadal Ghosh, Subodh Selukar

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出系统评估治愈模型适用性的方法,结合临床判断、Kaplan-Meier曲线分析和定量评估,通过骨髓移植数据示例提供实用指导,提升生存分析可靠性。

Comments 24 pages, 2 figues, to be submitted in Statistics in Medicine, First two authors have equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02038 2026-05-14 cs.CL cs.AI cs.DB 50%

BEAVER: An Enterprise Benchmark for Text-to-SQL

BEAVER:一个企业文本到SQL基准测试

Peter Baile Chen, Devin Yang, Weiyue Li, Fabian Wenz, Yi Zhang, Nesime Tatbul, Michael Cafarella, Çağatay Demiralp, Michael Stonebraker

机构 * MIT(麻省理工学院) Harvard University(哈佛大学) Greenshoe, Inc.(Greenshoe公司)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 BEAVER是首个基于企业私有数据仓库构建的文本到SQL基准测试,包含9128个问题-SQL对和19个领域的812张表,通过合成高质量查询和细粒度评估方法,揭示了现有模型在复杂企业场景下的性能差距。

Comments Dataset and code are available at https://beaverbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 50%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12313 2026-05-13 cs.CL cs.IR 50%

Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering

BioCreative IX MedHopQA 轨道概述:轨道描述、参与及多跳医学问答系统评估

Rezarta Islamaj, Joey Chan, Robert Leaman, Jongmyung Jung, Hyeongsoon Hwang, Quoc-An Nguyen, Hoang-Quynh Le, Harikrishnan Gurushankar Saisudha, Ganesh Chandrasekar, Rustam R. Taktashov, Nadezhda Yu. Bizyukova, Sofia I. R. Conceição, Paulo R. C. Lopes, Reem Abdel Salam, Mary Adewunmi, Zhiyong Lu

机构 * National Library of Medicine (NLM), National Institutes of Health (NIH)(美国国家医学图书馆(NLM)、国家卫生研究院(NIH)) University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学) VNU University of Engineering and Technology, Hanoi, Vietnam(越南河内工程大学) Concordia University, Montreal, QC, CA(蒙特利尔大学) Institute of Biomedical Chemistry (IBMC), 10 bld. 8, Pogodinskaya str., 119121 Moscow, Russia(俄罗斯生物医学化学研究所(IBMC)) LASIGE, Departamento de Informática, Faculdade de Ciências, Universidade de Lisboa, 1749-016 Lisbon, Portugal(葡萄牙里斯本大学 LASIGE 实验室) Faculty of Engineering, Computer Engineering Department Cairo University(埃及开罗大学工程学院) Menzies School of Health Research, Charles Darwin University, NT, Australia(澳大利亚查尔斯达尔文大学梅恩兹健康研究中心) CaresAI, Australia(澳大利亚 CaresAI)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文介绍了BioCreative IX MedHopQA共享任务,旨在评估大型语言模型在多跳推理中的表现,通过构建1000个挑战性问题,展示了检索增强生成策略的重要性,并提供了公开数据集和评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 50%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 50%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI 50%

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04320 2026-05-11 cs.SE 50%

Reproduction Test Generation for Java SWE Issues

Java SWE问题的再现测试生成

Toufique Ahmed, Jatin Ganhotra, Avraham Shinnar, Martin Hirzel

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文针对Java企业软件中的SWE问题,提出首个Java仓库级再现测试基准TDD-Bench-Java和高绩效的e-Otter++工具,填补了Python以外语言的研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 50%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 50%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20948 2026-05-04 cs.AI 50%

Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs

用于知识图谱中演绎推理的可控逻辑假设生成

Yisen Gao, Jiaxin Bai, Tianshi Zheng, Qingyun Sun, Ziwei Zhang, Xingcheng Fu, Jianxin Li, Yangqiu Song

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Hong Kong University of Science and Technology(香港理工大学) Beihang University(北航) Key Lab of Education Blockchain and Intelligent Technology(教育区块链与智能技术重点实验室) Guangxi Normal University(广西师范大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出CtrlHGen框架,通过监督学习和强化学习解决知识图谱中假设生成的可控性问题,提升假设生成的准确性和实用性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10426 2026-05-01 cs.CR cs.DC 50%

Differential Privacy for Secure Machine Learning in Healthcare IoT-Cloud Systems

医疗物联网-云系统中差分隐私的安全机器学习

N Mangala, Murtaza Rangwala, S Aishwarya, B Eswara Reddy, Rajkumar Buyya, KR Venugopal, SS Iyengar, LM Patnaik

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出多层物联网-边缘-云架构,通过差分隐私框架保护患者隐私,提升应急医疗响应速度,同时通过区块链增强安全性和边缘计算降低延迟。

Journal ref Future Gener. Comput. Syst. 176 (2026) 108548

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27470 2026-05-01 cs.CL 50%

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

HealthBench Professional: 评估大型语言模型在真实临床对话中的表现

Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, Akshay Jagadeesh, Khaled Saab, Johannes Heidecke, Ashley Alexander, Nate Gross, Karan Singhal

机构 * OpenAI

专题命中 医学数据与评测 :healthcare AI(abstract)

AI总结 本文提出HealthBench Professional基准,用于评估大型语言模型在临床实践中真实任务的表现,包含三个核心用例,通过医师评分系统评估模型性能,提供医疗AI领域跟踪前沿模型进展的测量工具。

Comments Data link in paper; Blog: https://openai.com/index/making-chatgpt-better-for-clinicians/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27358 2026-05-01 cs.AI 50%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14791 2026-05-01 cs.SE cs.AI 50%

Enabling Predictive Maintenance in District Heating Substations: A Labelled Dataset and Fault Detection Evaluation Framework based on Service Data

在区域供暖变电站中实现预测性维护:基于服务数据的标记数据集和故障检测评估框架

Cyriana M. A. Roelofs, Edison Guevara Bastidas, Thomas Hugo, Stefan Faulstich, Anna Cadenbach

机构 * Fraunhofer IEE(弗劳恩霍夫研究所)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出基于服务数据的标记数据集和故障检测评估框架,通过公开数据集和开源代码,实现区域供暖变电站的故障早期检测与诊断方法评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21190 2026-04-30 cs.CL cs.AI 50%

Lunguage: A Benchmark for Structured and Sequential Chest X-ray Interpretation

Lunguage: 用于结构化和序列化胸部X光解读的基准测试

Jong Hak Moon, Geon Choi, Paloma Rabaey, Min Gwan Kim, Jung-Oh Lee, Hyuk Gi Hong, Eun Woo Doe, Hangyul Yoon, Jiyoun Kim, Harshita Sharma, Daniel C. Castro, Javier Alvarez-Valle, Edward Choi

机构 * KAIST(韩国科学技术院) Ghent University(根特大学) Seoul National University Hospital(首尔国立大学医院) Seoul Medical Center(首尔医院) Yeungnam University College of Medicine(延世大学医学院) Microsoft Research Health Futures(微软研究院健康未来)

专题命中 医学数据与评测 :radiology(abstract)

AI总结 本文提出LUNGUAGE基准数据集,用于结构化放射学报告生成,支持单报告评估和多研究的纵向患者评估。通过两阶段结构化框架和LUNGUAGESCORE指标,实现对放射学报告的细粒度评估。

Comments CHIL (Conference on Health, Inference, and Learning) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22802 2026-04-28 cs.DL cs.SI stat.AP 50%

NIH-MPINet: A Large-Scale Feature-Rich Network Dataset for Mapping the Frontiers of Team Science

NIH-MPINet:一个大规模特征丰富的网络数据集,用于映射团队科学的前沿

Cuiran Shi, Shuying Han, Shreya Kusumanchi, Mia Zhou, Didong Li

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究提出NIH-MPINet网络数据集,涵盖2006-2023年NIH资助项目合作网络,包含30127个PI节点和86743条边,揭示19个合作社区及20个研究主题,展现科研主题随时间变化趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22708 2026-04-27 cs.MA 50%

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试

Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 50%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏