Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs
保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰
机构 * UAB(阿拉巴马大学伯明翰分校) ; Yale(耶鲁大学) ; UNSW(新南威尔士大学) ; Tulane(杜兰大学) ; Georgia Tech(佐治亚理工学院) ; NEU(东北大学) ; OSU(俄亥俄州立大学) ; UIowa(爱荷华大学) ; Harvard(哈佛大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。
Comments ECCV 2026