MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge
MM-JudgeBias:一个评估MLLM-as-a-Judge中组合偏见的基准
机构 * Seoul National University(首尔国立大学) ; NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国科学技术院人工智能实验室)
专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MM-JudgeBias基准,通过引入控制扰动和两个互补指标,评估MLLM-as-a-Judge中的组合偏见,揭示了九种偏见类型,并发现现有模型存在模态忽视和评估倾向性问题。
Comments ACL 2026 Main