Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety
在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性
机构 * Kinvectum AB(金维图姆公司)
专题命中 医疗多模态 :medical AI(title,abstract)
AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。
Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness