Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
通过感知扰动和奖励建模减轻多模态大语言模型作为评判者中的感知判断偏差
机构 * University of California, Berkeley(加州大学伯克利分校) ; KAIST(韩国科学技术院)
AI总结 本文通过构建感知扰动数据集和结合GRPO奖励与批排序目标的统一训练框架,解决了多模态大语言模型作为评判者时因视觉证据与文本线索冲突而产生的感知判断偏差问题,显著提升了感知忠实度和与人类评价的一致性。
Comments ICML 2026