arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2124 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2124 篇

2604.20423 2026-04-23 cs.RO 50%

OVPD: A Virtual-Physical Fusion Testing Dataset of OnSite Auton-omous Driving Challenge

OVPD:OnSite自动驾驶挑战赛的虚拟-物理融合测试数据集

Yuhang Zhang, Jiarui Zhang, Bowen Jian, Xin Zhou, Zhichao Lv, Peng Hang, Rongjie Yu, Ye Tian, Jian Sun

机构 * College of Transportation, Tongji University, Shanghai 201804, China(同济大学交通运输学院,上海201804,中国)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 OVPD数据集通过融合虚拟背景交通与车辆-基础设施感知,构建可控互动闭环测试环境,提供多模态数据用于长期规划与决策验证,支持安全、效率等多维度评估。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10401 2026-04-22 cs.CL 50%

NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data

NameBERT: 通过LLM增强的开放学术数据扩展基于名称的国籍分类

Cong Ming, Ruixin Shi, Yifan Hu

机构 * Northeastern University, United States(美国东北大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出NameBERT,利用LLM增强开放学术数据构建大规模名称-国籍数据集,通过生成低资源国家名称提升分类性能,实现高效且准确的国籍分类。

Comments 12 pages, 3 figures, 8 tables; accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026)

Journal ref Proceedings of Machine Learning Research 318 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18302 2026-04-21 cs.AI 50%

Toward Zero-Egress Psychiatric AI: On-Device LLM Deployment for Privacy-Preserving Mental Health Decision Support

迈向零数据外溢的心理AI:设备端LLM部署用于隐私保护的心理健康决策支持

Eranga Bandara, Asanga Gunaratna, Ross Gore, Anita H. Clayton, Christopher K. Rhea, Sachini Rajapakse, Isurunima Kularathna, Sachin Shetty, Ravi Mukkamala, Xueping Liang, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(旧 Dominion 大学) AI Motion Labs(AI Motion 实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Blanchfield Army Community Hospital(Blanchfield陆军社区医院) McDonald Army Health Center(McDonald陆军医疗中心)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出一种零数据外溢的设备端AI平台,通过本地执行推理管道,实现隐私保护的心理健康决策支持,使用轻量级LLM进行诊断评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02933 2026-04-21 cs.CL cs.HC 50%

Pearmut: Human Evaluation of Translation Made Trivial

Pearmut:使翻译的人工评估变得简单

Vilém Zouhar, Tom Kocmi

机构 * ETH Zurich(苏黎世联邦理工学院) Cohere

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 Pearmut通过轻量级平台简化多语言NLP的人工评估流程,支持机器翻译任务,提供多种评估协议和动态分配策略,使人工评估成为模型开发的常规环节。

Comments typeset with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17642 2026-04-21 eess.AS 50%

HCFD: A Benchmark for Audio Deepfake Detection in Healthcare

HCFD:医疗音频深度伪造检测基准

Mohd Mujtaba Akhtar, Girish, Muskaan Singh

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本文提出HCFD任务,针对病理语音条件下的编码器伪造检测,通过构建首个病理感知数据集和提出PHOENIX-Mamba框架,在多临床条件和编码器上实现最高性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17340 2026-04-21 cs.CL 50%

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

神经符号推荐冲突在多病共存临床指南中的解决

Shiyao Xie, Jian Du

机构 * Peking University(北京大学) National Institute of Health Data Science(国家健康数据科学研究院) Peking University Health Science Center(北京大学医学部) Institute of Medical Technology(医学技术研究院)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本文提出神经符号框架解决多病共存临床指南中的推荐冲突问题,通过多智能体系统和SAT求解器验证逻辑规则,发现90.6%的冲突为局部冲突,F1分数达0.861。

Comments Accepted by Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (Bridge Program on Logic & AI: Logical and Symbolic Reasoning in Language Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15456 2026-04-20 cs.AI 50%

DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI

DeepER-Med: 通过代理AI推进医学中的深度证据导向研究

Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu

机构 * Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH)) Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室) Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH)) Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH)) Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH)) Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室) Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部) University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国) Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH)) University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 DeepER-Med通过代理AI框架提升医学研究的证据生成流程,包含研究规划、协作和证据综合模块,并通过专家评估和真实临床案例验证其有效性。

Comments 37 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 50%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11094 2026-04-14 cs.SE cs.AI 50%

E2E-REME: Towards End-to-End Microservices Auto-Remediation via Experience-Simulation Reinforcement Fine-Tuning

E2E-REME:通过经验-模拟强化微服务自动修复

Lingzhe Zhang, Yunpeng Zhai, Tong Jia, Minghua He, Chiming Duan, Zhaoyang Liu, Bolin Ding, Ying Li

机构 * Peking University(北京大学) Key Laboratory of Data Intelligence and Security(数据智能与安全重点实验室) Alibaba Group(阿里巴巴集团) Key Laboratory of Data Space Technology and System(数据空间技术与系统重点实验室)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出E2E-MR任务,通过经验-模拟强化训练构建E2E-REME模型,实现从诊断报告自动生成可执行playbook,提升微服务系统修复的准确性和效率。

Comments accepted by FSE'26. arXiv admin note: text overlap with arXiv:2511.01166

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10853 2026-04-14 cs.AI 50%

A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness

一个用于空缺和重叠分析的基准:作为知识图谱任务准备性的测试

Maruf Ahmed Mridul, Rohit Kapa, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute, Troy, New York, United States(伦斯勒理工学院,纽约州特洛伊市,美国) Prudential Financial, Inc.(保德信金融集团)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出一个可执行且可审计的基准,用于评估知识图谱的质量,通过将自然语言合同文本与形式本体对齐,系统比较方法。该基准包括简化但多样的人寿保险合同、领域本体和知识库,以及58个结构化场景和SPARQL查询,展示显式建模提升空缺和重叠分析的一致性和诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09338 2026-04-13 cs.AI cs.CL 50%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08555 2026-04-13 cs.CL 50%

SynDocDis: A Metadata-Driven Framework for Generating Synthetic Physician Discussions Using Large Language Models

SynDocDis:一种基于元数据的生成合成医生讨论的框架

Beny Rubinstein, Sergio Matos

机构 * University of Aveiro(阿威罗大学) IEETA, DETI, LASI, University of Aveiro(阿威罗大学 IEETA、DETI、LASI)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 SynDocDis通过结合结构化提示技术和隐私保护的去标识病例元数据,生成临床准确的医生间对话,经九个肿瘤学和肝病学场景评估,显示优异的沟通效果和医学内容质量。

Journal ref In: Valente de Oliveira, J., Leite, J., Rodrigues, J., Dias, J., Cardoso, P. (eds) Progress in Artificial Intelligence. EPIA 2025. Lecture Notes in Computer Science(), vol 16121. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10477 2026-04-09 cs.CL 50%

PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responses

PEEM:提示工程评估指标用于可解释地联合评估提示和响应

Minki Hong, Eunsoo Lee, Sohyun Park, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出PEEM,一种联合且可解释的提示和响应评估框架,通过9个轴线评估提示和响应质量,结合LLM评估器输出评分和解释,提升提示设计的可解释性和优化效果。

Comments This is a preprint version of a paper accepted to IEEE Access. The final published version is available at DOI: 10.1109/ACCESS.2026.3679809

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04036 2026-04-07 cs.IR cs.CL 50%

MisEdu-RAG: A Misconception-Aware Dual-Hypergraph RAG for Novice Math Teachers

MisEdu-RAG:一种面向初学者数学教师的误解意识双超图RAG

Zhihan Guo, Rundong Xue, Yuting Lu, Jionghao Lin

机构 * The University of Hong Kong(香港大学) Xi'an Jiaotong University(西安交通大学) Carnegie Mellon University(卡内基梅隆大学) Monash University(莫纳什大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对初学者数学教师难以诊断和纠正学生错误的问题,提出基于双超图的RAG框架,通过组织教学知识和学生错误案例,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29087 2026-04-07 cs.SD eess.AS 50%

IQRA 2026: Interspeech Challenge on Automatic Pronunciation Assessment for Modern Standard Arabic (MSA)

IQRA 2026:现代标准阿拉伯语(MSA)自动发音评估挑战

Yassine El Kheir, Amit Meghanani, Mostafa Shahin, Omnia Ibrahim, Shammur Absar Chowdhury, Nada AlMarwani, Youssef Elshahawy, Ahmed Ali

机构 * DFKI(德国人工智能研究中心) Technical University of Berlin(柏林工业大学) University of Sheffield(谢菲尔德大学) University of New South Wales(新南威尔士大学) Alexandria University(亚历山大大学) QCRI(卡塔尔计算研究所) Taibah University(塔伊巴大学) HUMAIN

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文介绍了IQRA 2026挑战赛的成果,展示了在现代标准阿拉伯语发音检测与诊断(MDD)方面的研究进展,通过新增的Iqra_Extra_IS26数据集和多种模型方法,使F1分数提升了0.28。

Comments 5 pages paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14558 2026-04-07 cs.IR 50%

R2MED: A Benchmark for Reasoning-Driven Medical Retrieval

R2MED:一个面向推理驱动的医学检索基准

Xiangxu Zhang, Lei Li, Xiao Zhou, Zheng Liu

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 R2MED旨在解决医学检索中推理需求与现有方法的差距,通过876个查询涵盖三个任务,评估15种检索系统,发现最佳模型仅达31.4nDCG@10,凸显了推理驱动医学检索的挑战。

Comments 38 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02904 2026-04-06 cs.CL 50%

BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition

BioUNER:临床乌尔都语命名实体识别基准数据集

Wazir Ali, Adeeb Noor, Sanaullah Mahar, Alia, Muhammad Mazhar Younas

机构 * Department of Artificial Intelligence, Aror University(阿罗尔大学人工智能系)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出一个用于生物医学乌尔都语命名实体识别的基准数据集,通过爬取健康相关文章、医疗处方和医院健康博客等资料,经过预处理后由三名熟悉医学领域的标注者使用Doccano工具标注了153,000个词元,验证了数据集的金标准质量,并评估了多种机器学习和深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00290 2026-04-06 cs.AI cs.MA 50%

ClinicalReTrial: Clinical Trial Redesign with Self-Evolving Agents

临床试验重设计:具有自进化代理的临床试验重设计

Sixue Xing, Kerui Wu, Xuanye Xia, Meng Jiang, Jintai Chen, Tianfan Fu

机构 * University of Notre Dame(圣母大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01626 2026-04-03 cs.DB 50%

CogPic: A Multimodal Dataset for Early Cognitive Impairment Assessment via Picture Description Tasks

CogPic:一种通过图片描述任务进行早期认知障碍评估的多模态数据集

Liuyu Wu, Rui Feng, Jie Li, Wentao Xiang, Yi Zhang, Yin Cao, Siyang Song, Xiao Gu, Jianqing Li, Wei Wang

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文提出CogPic数据集,用于通过图片描述任务进行早期认知障碍评估,该数据集包含同步的音频、视觉和语言数据,由专家神经心理学家进行临床验证,为多模态研究提供了坚实基础。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01538 2026-04-03 cs.CL cs.AI 50%

Countering Catastrophic Forgetting of Large Language Models for Better Instruction Following via Weight-Space Model Merging

通过权重空间模型融合提升大语言模型的指令跟随能力以对抗灾难性遗忘

Mengxian Lyu, Cheng Peng, Ziyi Chen, Mengyuan Zhang, Jieting Li Lu, Yonghui Wu

机构 * University of Florida(佛罗里达大学) Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系) Department of Engineering Education, Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院工程教育系) Preston A. Wells, Jr. Center for Brain Tumor Therapy, Lillian S. Wells Department of Neurosurgery, University of Florida(佛罗里达大学莉莉安·S·威尔斯神经外科系普雷斯顿·A·威尔斯脑肿瘤治疗中心)

专题命中 医学数据与评测 :radiology(abstract)

AI总结 本文提出通过权重空间模型融合方法,有效缓解大语言模型在医疗领域微调时的灾难性遗忘问题,保留指令跟随能力并提升医疗任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21687 2026-04-03 cs.AI 50%

MIRAGE: The Illusion of Visual Understanding

MIRAGE:视觉理解的幻觉

Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Rajabalifardi, Fei-Fei Li, Ehsan Adeli, Euan Ashley

机构 * Stanford University(斯坦福大学)

专题命中 医学数据与评测 :pathology(abstract)

AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 50%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28924 2026-04-01 cs.CL 50%

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

CrossTrace:一种跨领域 grounded 科学推理轨迹数据集用于假设生成

Andrew Bouras, OMS-II Research Fellow

机构 * Nova Southeastern University Dr. Kiran C. Patel College of Osteopathic Medicine(诺瓦东南大学基兰·C·帕特尔骨科医学院)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 CrossTrace 是一个跨领域 grounded 科学推理轨迹数据集,包含 1389 个轨迹,涵盖生物医学研究、AI/ML 和跨领域工作。通过 QLoRA 微调 Qwen2.5-7B-Instruct,显著提升 IAScore 和结构合规性,验证跨领域推理轨迹的有效性。

Comments 14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08115 2026-04-01 cs.AI 50%

TeamMedAgents: Pareto-Efficient Multi-Agent Medical Reasoning Through Teamwork Theory

TeamMedAgents: 通过团队理论实现帕累托高效多智能体医疗推理

Pranav Pushkar Mishra, Mohammad Arvan, Mohan Zalake

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 TeamMedAgents基于团队理论构建模块化多智能体框架,通过共享心理模型、团队领导、团队导向等机制,提升医疗推理效率,实现帕累托效率前沿提升,并在低token成本下取得竞争性准确率。

Comments 19 pages, 6 figure, 12 tables, 2 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15355 2026-03-31 cs.CL 50%

HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning

HEAD-QA v2:扩展医疗基准以进行推理

Alexis Correa-Guillén, Carlos Gómez-Rodríguez, David Vilares

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 HEAD-QA v2扩展了医疗推理数据集,包含12000个西班牙专业考试问题,评估多种LLM性能,发现模型规模和推理能力是主要影响因素。

Comments LREC 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26235 2026-03-30 cs.CL 50%

GS-BrainText: A Multi-Site Brain Imaging Report Dataset from Generation Scotland for Clinical Natural Language Processing Development and Validation

GS-BrainText:来自Generation Scotland的多站点脑影像报告数据集,用于临床自然语言处理开发与验证

Beatrice Alex, Claire Grover, Arlene Casey, Richard Tobin, Heather Whalley, William Whiteley

机构 * Advanced Care Research Centre, University of Edinburgh(爱丁堡大学高级护理研究中心) School of Literatures, Languages and Cultures, University of Edinburgh(爱丁堡大学文学、语言与文化学院) Edinburgh Futures Institute, University of Edinburgh(爱丁堡大学爱丁堡未来研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Usher Institute, University of Edinburgh(爱丁堡大学厄舍研究所) Institute for Neuroscience and Cardiovascular Research, University of Edinburgh(爱丁堡大学神经科学与心血管研究所) Generation Scotland, Institute of Genetics and Cancer, University of Edinburgh(爱丁堡大学遗传学与癌症研究所苏格兰世代研究中心) NHS Lothian(NHS洛锡安) School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞瓦特大学数学与计算机科学学院)

专题命中 医学数据与评测 :radiology(abstract)

AI总结 GS-BrainText包含8511份脑部影像报告,其中2431份标注了24种脑部疾病表型,用于开发和验证通用的临床NLP算法,揭示NLP工具在泛化中的挑战。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 50%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23678 2026-03-26 cs.CL cs.AI 50%

PLACID: Privacy-preserving Large language models for Acronym Clinical Inference and Disambiguation

PLACID:隐私保护的大语言模型用于缩写临床推断和消歧

Manjushree B. Aithal, Ph. D., Alexander Kotz, James Mitchell, Ph. D

机构 * Department of Biomedical Informatics, University of Colorado Anschutz(科罗拉多大学安舒茨分校生物医学信息学系)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出PLACID模型,通过本地部署的小参数模型实现隐私保护的临床缩写消歧,利用通用本地模型检测缩写并路由至领域特定的生物医学模型以提高扩展准确性。

Comments 10 pages, 2 figures, Under review AMIA Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22492 2026-03-25 cs.AI 50%

RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts

RealCQA-V2:结构化科学图表视觉蕴含的诊断基准

Saleem Ahmed, Srirangaraj Setlur, Venu Govindaraju

机构 * University at Buffalo, Buffalo, NY, USA(布法罗大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 RealCQA-V2通过将图表问答转化为视觉前提证明任务,提供结构化视觉蕴含验证,揭示多模态推理中的局部-全局推理差距。

Comments Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23253 2026-03-25 cs.CR cs.AR 50%

On the Vulnerability of FHE Computation to Silent Data Corruption

关于FHE计算对静默数据破坏的脆弱性

Jianan Mu, Ge Yu, Zhaoxuan Kan, Song Bian, Liang Kong, Zizhen Liu, Cheng Liu, Jing Ye, Huawei Li

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 研究探讨FHE在真实硬件上的可靠性,分析其对瞬态故障的脆弱性,并评估不同容错机制的有效性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏