Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models
相同证据,不同答案:多模态大语言模型中的顺序敏感性审计
机构 * Stanford University(斯坦福大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。
Comments 22 pages, 4 figures, 5 tables