CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
CoRe:视觉语言模型中跨图像比较推理的综合框架
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV
AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。
Comments Accepted by ACMMM2026