Consistent but Dangerous: Per-Sample Safety Classification Reveals False Reliability in Medical Vision-Language Models
一致却危险:每样本安全分类揭示医疗视觉-语言模型中的虚假可靠性
机构 * SAIL Lab, University of New Haven(SAIL实验室,新罕布什尔大学)
AI总结 研究揭示医疗VLMs中一致性指标的缺陷,通过四象限分类发现危险样本高准确率且低熵,建议部署评估需结合文本基线以识别虚假可靠性。
Comments CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models