Truth, Trust, and Trouble: Medical AI on the Edge
真相、信任与麻烦:边缘上的医疗AI
机构 * Jamia Hamdard(贾迈亚哈姆达德大学) ; DSEU-Okhla ; Macquarie University(麦考瑞大学) ; Center for SDGC, Stanford University(SDGC中心,斯坦福大学)
AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。
Comments Accepted at EMNLP 2025 (Industry Track)