arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 141 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 141 篇

2606.21474 2026-06-23 cs.AI 新提交 50%

Towards Transparent Mental Health Insights: An Explainable AI Model for Career-Related Depression and Anxiety Among University Students Using Structured Data

迈向透明的心理健康洞察:基于结构化数据的可解释AI模型用于大学生职业相关抑郁与焦虑

Arsham Azam, Rasikh Ali, Tayyaba Farhat, Sheeraz Akram

机构 * Faculty of Computer Science and Information Technology, The Superior University(信息科技学院,超凡大学) Intelligent Data Visual Computing Research (IDVCR)(智能数据可视化计算研究组)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种结合多模态数据和联邦学习的可解释AI框架,在隐私保护下识别大学生职业相关心理问题早期指标,模型F1达89.12%,并识别出回避直视等关键行为标记。

Comments Accepted at AHTBE 2025 Conference, published in Medical Sciences Forum (MDPI). 18 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21359 2026-06-23 cs.CL 新提交 50%

Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

使用科学数据微调会增加幻觉:LLMs的多领域事实性评估

Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova, Fabio Barth, Georg Rehm, Sebastian Möller

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH(德国人工智能研究中心 GmbH) Technische Universität Berlin(柏林技术大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出SciFactCheck基准和模块化评估框架,发现科学微调模型在所有幻觉类型和科学领域上事实可靠性下降,且内部更不自信但语言更武断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20601 2026-06-23 cs.HC cs.AI 新提交 50%

Zhinong AI: A Design-Science Study of an AI-Enabled Agricultural Decision-Support Platform for Smallholder Production

Zhinong AI:面向小农生产的AI赋能农业决策支持平台的设计科学研究

Zhaoyang Li, Jiaqi Liu, Ruijie Zhang

机构 * University of Sanya(三亚大学) Hebei International Studies University(河北国际关系学院)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文通过设计科学研究,提出了一个集成信息推送、问答、诊断、日历管理等功能的小农决策支持平台,并构建了分层架构、闭环流程、评估指标和治理框架,为AI农业原型转化为可测试、负责任的基础设施提供了结构化研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21570 2026-06-23 quant-ph 新提交 50%

A Correlation Aware Quantum Feature Map for Variational Quantum Classification

一种用于变分量子分类的相关感知量子特征映射

Murat Kurt

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种相关感知量子特征映射(CAQFM),通过多种相关性度量将特征依赖关系融入量子编码,在三个基准数据集上提升变分量子分类器的分类性能。

Comments 23 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18950 2026-06-19 cs.AI 新提交 50%

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

RTSGameBench: 视觉语言模型战略推理的RTS基准

San Kim, Daechul Ahn, Reokyoung Kim, Hyeonbeom Choi, Seungyeon Jwa, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18203 2026-06-17 cs.CL cs.AI 新提交 50%

RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills

RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估

Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally

机构 * Google Research(谷歌研究院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 医学数据与评测 :healthcare AI(abstract)

AI总结 提出RubricsTree框架,通过专家对齐的层次化分类法(含100多个原子布尔规则)和上下文自适应路由,实现可扩展、可审计且不断演进的开放式评估,在HealthBench上使模型性能提升高达约66%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17815 2026-06-17 cs.CR cs.CL 新提交 50%

Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP Backdoors

超越原生成功:审计CLIP后门的部署接口暴露

Kunlan Xiang, Haomiao Yang, Wenbo Jiang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出DIFE框架审计CLIP后门在不同部署接口下的暴露情况,发现原生成功不代表全局安全,并引入BadTextTower填补文本编码器后门缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 50%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09460 2026-06-16 cs.AR 新提交 50%

A 65-nm Privacy-Preserving Neuromorphic Encoder With 7.13-nJ Efficiency, 2.38-Mb/mm^2 Item-Memory Density, and Federated Learning Support

一款65纳米隐私保护神经形态编码器,具有7.13纳焦效率、2.38兆比特/平方毫米项目内存密度和联邦学习支持

Boyang Cheng, Jianbo Liu, Steven Davis, Zephan M. Enciso, Likai Pei, Xueji Zhao, Muya Chang, Ningyuan Cao

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出一款65纳米隐私保护神经形态编码器,利用晶体管级工艺变化作为物理不可克隆熵,实现紧凑、设备特定且无需写入的项目内存,支持隐私保护生物信号编码,在多个生物信号数据集上达到93.2%-96.1%准确率。

Comments Submitted to IEEE Journal of Solid-State Circuits (JSSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13641 2026-06-12 quant-ph 新提交 50%

Generalized two-qubit Hamiltonian for Projective Quantum Feature Maps

广义两量子比特哈密顿量用于投影量子特征映射

Rafael Simões do Carmo, Edson Amaro Junior, Felipe Fanchini

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出基于广义两量子比特哈密顿量的投影量子特征映射,通过局部泡利场和两体泡利相互作用编码经典特征,在四个生物医学数据集上验证其相对于经典基线的统计显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11830 2026-06-11 cs.AI 新提交 50%

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

面向医学研究分析的技能增强型AI代理:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

Qianyu Yao, Fei Sun, Bocheng Huang, Wei Chen, Jiarui Jiang, Shu Quan, Yifei Chen, Wenjie Xu, Bo li, Liping Su, Ruoqiong Wu, Huhai Hong, Huimei Wang

机构 * AIPOCH PTE. LTD.

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究通过非小细胞肺癌免疫治疗生物标志物任务,评估技能增强型AI代理相比原生AI在转录组研究分析输出质量上的提升,发现质量信号方向性但未达统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 50%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 50%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-06-09 cs.CL cs.CR 新提交 50%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09132 2026-06-09 cs.AI 新提交 50%

Vision Language Model Helps Private Information De-Identification in Vision Data

视觉语言模型助力视觉数据中的隐私信息去标识化

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 医学数据与评测 :medical image(abstract)

AI总结 提出VisShield框架,通过专用指令微调数据集OPTIC和训练策略,使视觉语言模型精准定位并掩码敏感文本,有效保护医学图像等视觉数据中的隐私信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08966 2026-06-09 stat.ME 新提交 50%

Class Imbalance Corrections Failed to Enhance Discrimination, Model Calibration, and Prediction Stability: An Empirical Simulation Study Based on Clinical Dataset

类别不平衡校正未能提升判别能力、模型校准和预测稳定性:基于临床数据集的实证模拟研究

Wachiranun Sirikul, Natthanaphop Isaradech, Wuttipat Kiratipaisarl, Pakpoom Wongyikul, Noraworn Jirattikanwong, Phichayut Phinyo

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本研究通过模拟临床预测模型开发,发现类别不平衡校正(如重采样和算法级调整)不能改善模型判别能力,反而导致校准不良和预测不稳定,建议不应常规进行不平衡校正。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08673 2026-06-09 cs.CL 新提交 50%

ClinicalAligner26AM: A Cross-Lingual Aligner for Dataset Translation; Evidences from the MultiClinCorpus Shared Task

ClinicalAligner26AM: 用于数据集翻译的跨语言对齐器;来自MultiClinCorpus共享任务的证据

François Remy

机构 * Parallia Healthcare AI(Parallia医疗人工智能)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出ClinicalAligner26AM,一种基于ClinicalEncoder26AM初始化的生物医学临床文本多语言对齐模型,通过Sinkhorn-Knop最优传输融合多级信号构建软对齐目标,在MultiClinCorpus任务中跨语言投影实体标注,字符加权F1超0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 50%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 50%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 50%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 50%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏