Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking
重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究
机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。
Comments 6 pages, 3 tables, 1 figure
Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025