arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 2124 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 2124 篇

2404.10092 2026-06-17 cs.CR 50%

Integration of Federated Learning and Blockchain in Healthcare: A Tutorial

联邦学习与区块链在医疗领域的整合:教程

Yahya Shahsavari, Oussama A. Dambri, Yaser Baseri, Abdelhakim Senhaji Hafid, Dimitrios Makrakis

专题命中 医学数据与评测 :medical image(abstract)

AI总结 本文探讨联邦学习与区块链在医疗领域的整合,通过三种架构平衡去中心化、可扩展性和可靠性,提升数据安全性和协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 50%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09460 2026-06-16 cs.AR 新提交 50%

A 65-nm Privacy-Preserving Neuromorphic Encoder With 7.13-nJ Efficiency, 2.38-Mb/mm^2 Item-Memory Density, and Federated Learning Support

一款65纳米隐私保护神经形态编码器,具有7.13纳焦效率、2.38兆比特/平方毫米项目内存密度和联邦学习支持

Boyang Cheng, Jianbo Liu, Steven Davis, Zephan M. Enciso, Likai Pei, Xueji Zhao, Muya Chang, Ningyuan Cao

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出一款65纳米隐私保护神经形态编码器,利用晶体管级工艺变化作为物理不可克隆熵,实现紧凑、设备特定且无需写入的项目内存,支持隐私保护生物信号编码,在多个生物信号数据集上达到93.2%-96.1%准确率。

Comments Submitted to IEEE Journal of Solid-State Circuits (JSSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13641 2026-06-12 quant-ph 新提交 50%

Generalized two-qubit Hamiltonian for Projective Quantum Feature Maps

广义两量子比特哈密顿量用于投影量子特征映射

Rafael Simões do Carmo, Edson Amaro Junior, Felipe Fanchini

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出基于广义两量子比特哈密顿量的投影量子特征映射,通过局部泡利场和两体泡利相互作用编码经典特征,在四个生物医学数据集上验证其相对于经典基线的统计显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11830 2026-06-11 cs.AI 新提交 50%

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

面向医学研究分析的技能增强型AI代理:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

Qianyu Yao, Fei Sun, Bocheng Huang, Wei Chen, Jiarui Jiang, Shu Quan, Yifei Chen, Wenjie Xu, Bo li, Liping Su, Ruoqiong Wu, Huhai Hong, Huimei Wang

机构 * AIPOCH PTE. LTD.

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究通过非小细胞肺癌免疫治疗生物标志物任务,评估技能增强型AI代理相比原生AI在转录组研究分析输出质量上的提升,发现质量信号方向性但未达统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 50%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 50%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11423 2026-06-10 quant-ph 版本更新 50%

Noisy-QSMOTE: Robustness Analysis of Quantum SMOTE under Quantum-Inspired Noise for Condition Monitoring and Fault Classification in Industrial and Energy Systems

噪声-QSMOTE:量子SMOTE在量子启发噪声下的鲁棒性分析及其在工业与能源系统状态监测和故障分类中的应用

Amit S. Patel, Himanshukumar R. Patel, Bikash K. Behera

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 研究QSMOTE在量子噪声下的鲁棒性,通过注入噪声到相似性估计过程,评估其对工业故障分类性能的影响,实验表明QSMOTE有效缓解类不平衡并提升非线性分类器性能。

Comments 48 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-06-09 cs.CL cs.CR 新提交 50%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09132 2026-06-09 cs.AI 新提交 50%

Vision Language Model Helps Private Information De-Identification in Vision Data

视觉语言模型助力视觉数据中的隐私信息去标识化

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 医学数据与评测 :medical image(abstract)

AI总结 提出VisShield框架,通过专用指令微调数据集OPTIC和训练策略,使视觉语言模型精准定位并掩码敏感文本,有效保护医学图像等视觉数据中的隐私信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08966 2026-06-09 stat.ME 新提交 50%

Class Imbalance Corrections Failed to Enhance Discrimination, Model Calibration, and Prediction Stability: An Empirical Simulation Study Based on Clinical Dataset

类别不平衡校正未能提升判别能力、模型校准和预测稳定性:基于临床数据集的实证模拟研究

Wachiranun Sirikul, Natthanaphop Isaradech, Wuttipat Kiratipaisarl, Pakpoom Wongyikul, Noraworn Jirattikanwong, Phichayut Phinyo

专题命中 医学数据与评测 :pathology(abstract)

AI总结 本研究通过模拟临床预测模型开发,发现类别不平衡校正(如重采样和算法级调整)不能改善模型判别能力,反而导致校准不良和预测不稳定,建议不应常规进行不平衡校正。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08673 2026-06-09 cs.CL 新提交 50%

ClinicalAligner26AM: A Cross-Lingual Aligner for Dataset Translation; Evidences from the MultiClinCorpus Shared Task

ClinicalAligner26AM: 用于数据集翻译的跨语言对齐器;来自MultiClinCorpus共享任务的证据

François Remy

机构 * Parallia Healthcare AI(Parallia医疗人工智能)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出ClinicalAligner26AM,一种基于ClinicalEncoder26AM初始化的生物医学临床文本多语言对齐模型,通过Sinkhorn-Knop最优传输融合多级信号构建软对齐目标,在MultiClinCorpus任务中跨语言投影实体标注,字符加权F1超0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 50%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07542 2026-06-09 cs.CY cs.AI 新提交 50%

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

DIYHealth Suite:家庭健康管理的数据集、模型与基准

Changshuo Liu, Junran Wu, Zhongle Xie, Wenqiao Zhang, Kaiping Zheng, Jiaqi Zhu, Qingpeng Cai, Ooi Gene Anne, Marcus Chun Jin Tan, Jianwei Yin, James Wei Luen Yip, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对家庭健康管理中的数据异构、任务多变和缺乏统一基准等问题,提出包含大规模多模态数据集DIYHealth-900K、自适应基础模型DIYHealthGPT(采用混合超低秩适应技术)和首个家庭护理基准DIYHealthBench的综合框架,在11项任务上达到最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07248 2026-06-09 cs.GR 版本更新 50%

Distinguishing Imitation Error from Intrinsic Motion Learning Difficulty

区分模仿误差与内在运动学习难度

Zhaorui Meng, Lu Yin, Xinrui Chen, Chengxu Zuo, Anjun Chen, Shihui Guo, Yipeng Qin

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出基于物理的扭矩变化分数(TVS),量化运动固有学习难度,用于区分策略缺陷与运动本身难度导致的模仿失败,并支持策略评估、性能分析和数据质量控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17455 2026-06-09 cs.CL cs.AI 版本更新 50%

Understanding Benchmark Language Under Weakened Formal Semantics

弱化形式语义下的基准语言理解

Haoyang Chen, Kumiko Tanaka-Ishii

机构 * Department of Computer Science and Engineering(计算机科学与工程系) School of Fundamental Science and Engineering(基础科学与工程学院) Waseda University(早稻田大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 提出可计算表示方法,通过外部知识检索提取可执行代码,在数学推理、多步推理等基准上超越纯文本推理和单次代码执行,提供可扩展、可检查的语义证据。

Comments Accepted to Transactions of the Association for Computational Linguistics (TACL). 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07297 2026-06-08 cs.SE cs.CL 新提交 50%

SWE-Explore: Benchmarking How Coding Agents Explore Repositories

SWE-Explore: 基准测试编码智能体如何探索代码仓库

Shaoqiu Zhang, Yuhang Wang, Jialiang Liang, Yuling Shi, Wenhao Zeng, Maoquan Wang, Shilin He, Ningyuan Xu, Siyu Ye, Kai Cai, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 50%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05966 2026-06-05 cs.DB cs.AI 50%

Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs

物理推理的因果支架:面向视觉语言模型中因果启发的物理世界理解基准

Tianyi Tang, Zhuoyi Lin, Zeyu Feng, Tianyi Ma, Yew-Soon Ong, Ivor Tsang, Haiyan Yin

机构 * CFAR(因果推理研究所) IHPC(信息技术研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出CausalPhys基准(含3000+视频/图像问题及因果图),并设计因果图度量评估VLM推理,进一步提出因果理性微调(CRFT)提升推理准确性与可解释性。

Comments Accepted by KDD 2026 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06126 2026-06-05 stat.ME 50%

IOCC: Aligning Semantic and Cluster Centers for Few-shot Short Text Clustering

IOCC: 语义与聚类中心对齐的少样本短文本聚类

Zhihao Yao

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文提出IOCC方法,通过交互增强最优传输和中心感知对比学习模块,实现语义中心与聚类中心对齐,提升短文本聚类性能。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09853 2026-06-04 cs.CL cs.AI 50%

MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication

MedRedFlag:探究LLMs如何在真实健康沟通中纠正误解

Sraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal

机构 * Independent Researcher(独立研究者) Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 医学数据与评测 :medical AI(abstract)

AI总结 本研究通过构建MedRedFlag数据集(1100+个来自Reddit的需纠正问题),系统比较了先进LLMs与临床医生的回应,发现LLMs常未能纠正问题中的错误前提,可能导致次优医疗决策,揭示了患者面向医疗AI系统的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI 50%

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02997 2026-06-03 physics.comp-ph 50%

TransportBench: A Comprehensive Benchmark for Non-Equilibrium Flow Transport

TransportBench:非平衡流动传输的综合基准

Xu Wang, Minghao Li, Qizhen Hong, Yang Liu, Chen-an Zhang, Shuai Zhang, Wenhao Li, Yonghao Zhang, Tianbai Xiao

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对现有数据集对非平衡传输现象支持有限的问题,提出TransportBench高保真数据集与标准化基准,系统评估神经网络模型在连续/稀薄、低速/高超声速、惰性/化学反应气体等广泛物理场景下的表现。

Comments 40 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1206.2587 2026-06-03 cs.NE cs.SY eess.SY 50%

Exploiting Particle Swarm Optimization in Multiple Faults Fuzzy Detection

利用粒子群优化进行多故障模糊检测

Imtiez Fliss, Moncef Tagina

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种基于粒子群优化(PSO)的在线多故障模糊检测方法,通过优化隶属函数设计提高效率,并在三水箱液压系统仿真中与遗传算法(GA)对比验证有效性。

Comments Extended version of : Fliss I. and Tagina M., Multiple faults fuzzy detection approach improved by Particle Swarm Optimization, published in The 8th International Conference of Modelling and Simulation - MOSIM'10, Hammamet, Tunisia, May 10-12, 2010; Journal of Computing, Volume 4, Issue 2, February 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29274 2026-05-29 cs.CL 50%

Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

基于LLM的自动评分中可学习的评估技能:通过迭代优化构建评分标准

Yun Wang, Xin Xia, Xuansheng Wu, Xiaoming Zhai, Ninghao Liu

机构 * School of Computing, University of Georgia, Athens, GA, USA(佐治亚大学计算机学院) AI4STEM Education Center, University of Georgia, Athens, GA, USA(佐治亚大学AI4STEM教育中心) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出一种迭代框架,使LLM能从评分经验中学习评估技能(即与题目无关的自然语言程序性知识),自动构建评分标准,无需人工干预,在ASAP-SAS数据集上超越专家编写的评分标准。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29225 2026-05-29 cs.AI 50%

BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents

BenchTrace: 用于测试LLM智能体反思能力和受控进化的基准

Jiahao Huang, Fei Cheng, Junfeng Jiang, Zefan Yu, Akiko Aizawa

机构 * University of Tokyo(东京大学) Kyoto University(京都大学) National Institute of Informatics(日本信息处理学会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出BenchTrace基准,通过反思评估和进化评估两个任务,结合失败避免率(FAR)指标,系统评估LLM智能体的自我进化能力,实验发现当前模型在反思诊断和泛化上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28129 2026-05-28 cs.AI 50%

Do Clinical Models Change Treatment Decisions?

临床模型是否会改变治疗决策?

Dongkyu Cho, Miao Zhang, Rumi Chunara

机构 * New York University(纽约大学)

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究提出ClinPivot基准,通过生物医学关系和变化的患者情境评估临床基础模型在治疗决策中的适应性,发现强医学QA能力不能可靠预测决策表现。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28035 2026-05-28 cs.AI cs.MM cs.SD 50%

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng

机构 * Shanghai University(上海大学) Beijing Institute of Technology(北京理工大学) Shanghai Film Academy(上海电影学院) Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) Inkeverse Group Limited(Inkeverse集团有限公司) The University of Adelaide(阿德莱德大学) Beijing University of Technology(北京工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenNLP Lab(OpenNLP实验室)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27827 2026-05-28 cs.AI cs.CY 50%

Operational AI Deployment Assurance: Governance-State Orchestration Under Threshold-Sensitive Deployment Conditions -- A Governance Framework for High-Stakes AI Systems

运营级AI部署保障:阈值敏感部署条件下的治理状态编排——高风险AI系统的治理框架

Khalid Adnan Alsayed

机构 * Ducaltus | AI Assurance \& Governance Newcastle upon Tyne, United Kingdom School of Computing, Engineering \& Digital Technologies Teesside University Middlesbrough, United Kingdom

专题命中 医学数据与评测 :healthcare AI(abstract)

AI总结 提出运营级AI部署保障(OADA)框架,通过部署保障分数、就绪分类、阈值稳定区、治理升级状态和修复感知保障推进等机制,将公平性分歧、子组不稳定性和阈值敏感性转化为部署导向的治理决策,以解决高风险AI系统中静态指标报告和事后审计的不足。

Comments 13 pages, 3 figures, governance-oriented framework for operational AI deployment assurance in high-stakes systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24636 2026-05-27 cs.AI cs.CL 50%

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

GlobalDentBench:一个用于评估牙科领域大语言模型临床推理能力并包含专家校准的多国基准

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang, Junying Chen, Tianrui Liu, Zhuhui Bai, Zixu Zhang, Pradeep Singh, Xiang Liu, Jianquan Li, Nhan L Tran, Falk Schwendicke, Zuolin Jin, Lijian Jin, Liangyi Chen, Wei-fa Yang, Benyou Wang, Junwen Wang, Shan Jiang

机构 * Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Periodontology, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)牙周科) Beijing Institute of Collaborative Innovation(北京协同创新研究院) Department of Orthodontics, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)正畸科) Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)) College of Future Technology, Peking University(北京大学未来技术学院) Freedom AI New Cornerstone Science Laboratory, National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University, Beijing 100871, China(新基石科学实验室、国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究院、北京大学未来技术学院、生命科学中心,北京大学,北京100871,中国) IDG/McGovern Institute for Brain Research, Peking University, Beijing 100871, China(IDG/ McGovern脑科学研究院,北京大学,北京100871,中国) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院口腔颌面外科系) Shenzhen Loop Area Institute(深圳河套学院) Department of Cancer Biology, Mayo Clinic Arizona, 5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA(梅奥诊所亚利桑那分部癌症生物学部门,5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA) Department of Conservative Dentistry, Periodontology and Digital Dentistry, LMU University Hospital, LMU Munich, Munich, Germany(慕尼黑大学医院保守牙科、牙周病学和数字牙科部门,慕尼黑,德国,慕尼黑大学) Division of Periodontology & Implant Dentistry, Faculty of Dentistry, The University of Hong Kong, Hong Kong, SAR, China(香港大学牙科学院牙周病学与种植牙科系,香港,中国)

专题命中 医学数据与评测 :clinical AI(abstract)

AI总结 提出首个跨国牙科基准GlobalDentBench,包含14个专科、88个国家的8978道专家验证题目,评估三种推理层次,揭示当前大语言模型在牙科临床推理中性能随复杂度下降且存在高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏