ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
机构 * University of Copenhagen(哥本哈根大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG
Comments Code, dataset, and checkpoints are publicly available at https://github.com/danaesavi/ImageChain; v2: added human annotation study to validate SimRate